iFlytek PDF 与图片 OCR
io.github.iflytek/iFly-Skills/iflytek-pdf-image-ocr
讯飞 PDF 与图片 OCR 技能,同时支持图片 OCR(AI 大模型 OCR)与 PDF 文档识别。用于对图片或 PDF 做 OCR、从图像/PDF 中提取文本、把 PDF 转换为 Word/Markdown,或对图片与 PDF 执行其他 OCR 任务;支持多语言文本提取、版面理解与多种输出格式。
“Images” 共 4 个结果
io.github.iflytek/iFly-Skills/iflytek-pdf-image-ocr
讯飞 PDF 与图片 OCR 技能,同时支持图片 OCR(AI 大模型 OCR)与 PDF 文档识别。用于对图片或 PDF 做 OCR、从图像/PDF 中提取文本、把 PDF 转换为 Word/Markdown,或对图片与 PDF 执行其他 OCR 任务;支持多语言文本提取、版面理解与多种输出格式。
io.github.iflytek/iFly-Skills/iflytek-image-understanding
用于用户要求分析图片、描述图像内容或回答与图片相关问题的场景。讯飞图片理解——基于星火视觉(Spark Vision)模型分析图片并回答问题,采用 WebSocket API,仅使用 Python 标准库,无需 pip 依赖。
io.github.MiniMax-AI/skills/vision-analysis
借助 MiniMax 视觉 MCP 工具分析、描述并提取图像信息。适用场景:用户分享图片文件路径或 URL(消息中含 .jpg、.jpeg、.png、.gif、.webp、.bmp、.svg 扩展名),或在提及图像时使用 analyze、analyse、describe、explain、understand、look at、review、extract text、OCR 等词,对象可以是 image、screenshot、diagram、chart、mockup、wireframe、photo。另外触发:UI 原型评审、线框图分析、设计点评、图表数据提取、物体识别、人/动物/活动识别。
io.github.MiniMax-AI/skills/minimax-multimodal-toolkit
使用 mmx 通过 MiniMax AI 平台生成文本、图像、视频、语音与音乐。当用户想在终端里创作媒体内容、与 MiniMax 模型对话、执行网页搜索或管理 MiniMax API 资源时使用。