ocr
共收录 26 个与 ocr 相关的 MCP Server 与 Agent Skill,均附安装命令、来源与热度数据,可直接复制到 Cursor、Claude Code 等客户端。
Markdown 转换器
v1.0.0
io.clawhub.steipete/markdown-converter
使用 markitdown 将文档与文件转换为 Markdown。在转换 PDF、Word(.docx)、PowerPoint(.pptx)、Excel(.xlsx/.xls)、HTML、CSV、JSON、XML、图片(含 EXIF/OCR)、音频(含转写)、ZIP 归档、YouTube 链接或 EPub 为 Markdown 以供 LLM 处理或文本分析时使用。
本地 OCR(免 API Key)
v1.0.0
io.clawhub.shaw555/ocr-local
使用 Tesseract.js OCR 从图片中提取文字(100% 本地运行,无需 API Key)。支持中文(简体/繁体)与英文。
图像 OCR
v1.0.0
io.clawhub.xejrax/image-ocr
使用 Tesseract OCR 从图像中提取文字。
腾讯云 COS 对象存储
v1.1.9
io.clawhub.shawnminh/tencent-cos-skill
腾讯云对象存储(COS)和数据万象(CI)集成技能。覆盖文件存储管理、AI处理和知识库三大核心场景。 存储场景:上传文件到云端、下载云端文件、批量管理存储桶文件、获取文件签名链接分享、查看文件元信息、查询数据万象及子服务开通状态。 图片处理场景:图片质量评估打分、AI超分辨率放大、AI智能裁剪、二维码/条形码识别、添加文字水印、获取图片EXIF信息、缩放、裁剪、旋转、格式转换。 文档处理场景:Word/Excel/PPT等办公文档转PDF、文档预览。 媒体处理场景:视频智能封面提取、视频转码、视频截帧、获取媒体信息。 内容审核场景:图片/视频/音频/文本/文档内容审核,检测违规内容。 智能语音
QVeris 能力发现引擎
v1.0.9
io.clawhub.linfangw/qveris-official
QVeris 是一个能力发现与工具调用引擎。
图像理解
v1.0.0
io.clawhub.cntuang/image-vision
解析并理解图像:描述内容、提取文字、回答问题、对比视觉素材,并从 JPG、PNG、GI……中抽取结构化数据
DeepRead OCR
v1.1.0
io.clawhub.uday390/deepread-ocr
AI 原生 OCR 平台,几分钟内把文档转换为高精度数据。
MinerU PDF 解析器
v1.0.1
io.clawhub.easonai-5589/mineru
用 MinerU API 解析 PDF/Word/PPT/图片为 Markdown,支持公式、表格、OCR。适用于论文解析、文档提取。
Tesseract OCR 文字识别
v1.0.0
io.clawhub.whalefell/tesseract-ocr
通过命令行直接调用 Tesseract OCR 引擎从图片中提取文字。支持包括中文、英文在内的多种语言。
MinerU 文档抽取
v0.1.30
io.clawhub.mineru-extract/mineru-document-extractor
MinerU 文档抽取——将 PDF、扫描文档、图片、Word(DOC/DOCX)、PowerPoint(PPT/PPTX)。
Nanonets OCR 文档抽取
v1.0.2
io.clawhub.shhdwi/docstrange
Nanonets 文档抽取 API。将 PDF 与图片转换为带置信度评分的 markdown、JSON 或 CSV。适用于 OCR 文档、提取发票字段、解析收据或将表格转为结构化数据。
截图文字 OCR 识别
v1.0.0
io.clawhub.sxliuyu/screenshot-ocr
截图 OCR 识别工具。截图→自动识别文字→复制/保存,适合提取图片内容、表格数据、验证码。
pdf-ocr-layout 文档版面解析
v1.0.2
io.clawhub.baokui/pdf-ocr-layout
基于智谱 GLM-OCR、GLM-4.7 及 GLM-4.6V 的多模态文档深度解析工具。 Use when: - 需要高精度提取文档(PDF/图片)中的表格并转换为 Markdown 格式 - 需要从文档页面中自动裁剪并提取插图、图表为独立文件 - 需要对提取的图表进行深度语义理解(基于 GLM-4.6V 视觉分析) - 需要对提取的表格数据进行逻辑分析(基于 GLM-4.7 文本分析) 核心架构: 1. 视觉提取:GLM-OCR 2. 语义理解:GLM-4.7 (纯文本/表格) + GLM-4.6V (多模态/图像)
Pdf 文件处理
v1.0.0
io.clawhub.yang1002378395-cmyk/pdf-processor-cn
只要用户想对 PDF 文件做任何事,都使用本技能。
建筑 PDF 结构化提取
v2.0.0
io.clawhub.datadrivenconstruction/pdf-to-structured
从建筑行业 PDF 中提取结构化数据。将规格书、BOM 物料清单、进度表、报告等从 PDF 转为 Excel/CSV/JSON。扫描件用 OCR 处理,原生 PDF 用 pdfplumber。
PaddleOCR 文字识别
v2.0.0
io.clawhub.bobholamovic/paddleocr-text-recognition
当用户需要从图片、照片、扫描件、截图或扫描版 PDF 中提取文字时使用此技能。
Python OCR 文字识别
v1.0.0
io.clawhub.roamer-remote/ocr-python
使用 PaddleOCR 在 Python 中提取图片和扫描版 PDF 中的中英文文字,适用于发票、合同等文档。
OCR 文档识别
v1.0.0
io.clawhub.tanis90/ocr-document
OCR 文档提取——使用 OCR 从扫描文档、照片和图像中提取文字。适用于读取扫描 PDF、拍摄的书页、手写笔记等场景。
Nutrient 文档处理
v1.3.0
io.clawhub.jdrhyne/nutrient-openclaw
使用固定版本的 Nutrient OpenClaw 插件,对最后已知的本地额度记录执行文档转换、OCR、内容抽取、涂黑遮蔽、加水印、签名或检查。仅把 OpenClaw 的文档处理请求路由到它声明的工具。需将该处理视为外部、消耗额度的 DWS 调用:每次调用都要给出有上限的费用预估,并在执行前获得确认。
图片 OCR 识别
v1.0.0
io.clawhub.igetmm/image-ocr-reader
使用 OCR 从图片中提取文字,支持中英文,兼容 jpg、png、jpeg 等常见格式。
夸克扫描王 OCR文字识别 - yescan ocr universal
v1.0.14
io.clawhub.yescan-ai/yescan-ocr-universal
由夸克扫描王提供的高准取率 OCR 文字识别工具,支持印刷、手写、表格、多语言、公式等各种场景。支持图片、截图、扫描件中的文字提取,包括手写文档、表格内容、数学公式、商品图片等复杂场景。精准识别各类证件(身份证、社保卡、驾驶证、行驶证、港澳通行证、学位证等证件)及票据(增值税发票、火车票、英文发票等票据),同时支持医疗报告单、营业执照、习题题目等专业文档识别。
日语导师
v1.0.2
io.clawhub.chndranndr/japanese-tutor
互动式日语学习助手。支持词汇、语法、测验、角色扮演,可解析 PDF/DOCX 材料辅助学习/作业,并提供 OCR 翻译。
MarkItDown 文档转换
v1.0.1
io.clawhub.karmanverma/markitdown-skill
将文档转换为 Markdown 的 OpenClaw 技能。提供 Microsoft MarkItDown 库的文档与工具。支持 PDF、Word、PowerPoint、Excel、图像(OCR)、音频(转写)、HTML、YouTube。
Upstage 文档解析
v1.0.5
io.clawhub.upstage-deployment/upstage-document-parse
使用 Upstage Document Parse 将文档(PDF、图片、DOCX、PPTX、XLSX、HWP)解析为保留版式结构的 Markdown/HTML,包含表格、图示、标题和边界框。
腾讯云 COS 与数据万象
v1.2.0
io.clawhub.shawnminh/tencentcloud-cos
腾讯云对象存储(COS)和数据万象(CI)集成技能。覆盖文件存储管理、AI处理和知识库三大核心场景。 存储场景:上传文件到云端、下载云端文件、批量管理存储桶文件、获取文件签名链接分享、查看文件元信息、查询数据万象及子服务开通状态。 图片处理场景:图片质量评估打分、AI超分辨率放大、AI智能裁剪、二维码/条形码识别、添加文字水印、获取图片EXIF信息、缩放、裁剪、旋转、格式转换。 文档处理场景:Word/Excel/PPT等办公文档转PDF、文档预览。 媒体处理场景:视频智能封面提取、视频转码、视频截帧、获取媒体信息。 内容审核场景:图片/视频/音频/文本/文档内容审核,检测违规内容。 智能语音
Captcha Auto 智能验证码识别
v1.0.6
io.clawhub.annoyingc/captcha-auto
智能验证码自动识别 Skill - 混合模式(本地 Tesseract OCR + 阿里云千问 3 VL Plus)。支持两阶段输入框查找、安全隐私警告。用于网页自动化中的验证码识别、填写和提交。