document-parser
v1.0.8
从多种文档格式(PDF、Word、HTML)解析并提取结构化数据。
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 1,401 个资源 · 第 25 / 30 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.8
从多种文档格式(PDF、Word、HTML)解析并提取结构化数据。
v1.0.0
通过 URL 即时分享 HTML/Markdown 文档;可从任意 AI 工具创建、编辑、删除文档。
v0.2.9
去噪网页搜索的 Rust MCP 服务器——为 AI 智能体抓取、清洗并重排网页内容。
v1.0.5
AI 答案复制器——将 Markdown 转换为 PDF、DOCX、HTML、LaTeX、CSV、JSON、XML、XLSX、RTF、PNG。
v3.1.0
HTML 转 PDF 与网页截图的远程 MCP 服务器,支持 OAuth 与 API key 认证。
v1.9.7
65 个以上 AI 工具集于 MCP:研究、写作、编码、抓取、翻译、RAG、智能体记忆、工作流。
v0.2.8
去噪网页搜索的 Rust MCP 服务器——为 AI 智能体抓取、清洗并重排网页内容。
v1.2.0
通过 MCP 阅读 Project Gutenberg 图书:检索、获取元数据并按段落读取正文。
v0.4.1
面向 AI 智能体的浏览器引擎,输入 HTML、输出语义对象模型,token 减少 16 倍。
v1.0.0
面向 AI 智能体的实时数据 API:股票、天气、外汇、物流、搜索、抓取、新闻、IP。
v1.1.0
通过 MCP 工具读取并编辑 GitBook 同步文档中的 HTML/Markdown 表格。
v1.0.1
为 AI 智能体提供网页抓取、搜索、监控与 HTML 转 Markdown。
v0.1.1
将 HTML MUP 面板转换为供 LLM 使用的交互式 UI 工具的 MCP 服务器。
v0.5.2
分析 Figma 设计稿对开发与 AI 的就绪度,含 39 条规则、评分与 HTML 报告。
v0.1.2
通用网页内容抽取——任意 URL 转为适配 LLM 的 markdown,支持 HTML、YouTube、PDF、DOCX。
v1.0.2
ZebPay 加密货币交易所的 MCP 服务器——获取行情、余额并管理订单。
v1.1.1
codewiki.google 的 MCP 服务器:搜索仓库、获取 wiki 文档、提问答疑。
v0.2.2
转换 PDF、DOCX、HTML、Markdown 与纯文本,便于注入 AI 助手上下文。
v1.0.0
面向 AI Agent 的即时网页发布——POST 一段 HTML 即得到线上可访问 URL,无需注册账号。
v1.1.0
使用 Prince 将 Markdown、HTML 与网页转换为高质量 PDF。
v1.0.3
Markdown MCP 服务器:表格、目录、HTML 转换与格式化。
v1.0.2
生成可直接上线的 HTML 落地页的 MCP 服务器。
v1.0.3
Base64、URL 与 HTML 编解码的 MCP 服务器。
v1.0.1
Markdown 处理、目录生成与 HTML 转换。
v1.0.1
生成 HTML meta 标签与 Open Graph 元数据。
v1.2.0
通过粘贴、上传与 ZIP 部署,快速发布并管理 HTML 站点
v1.2.0
基于 Playwright 将 HTML 或 URL 转换为 PDF 文档
v1.3.5
OpenGraph.io API 的 MCP 服务器——获取 OG 数据、截图、网页抓取与图片生成。
v0.1.4
在 AWS 无服务器 RAGStack 知识库上检索、对话、上传与抓取网页。
v1.4.7
轻量级 DMARC 解析器:自动拉取邮件报告,在一体化应用中可视化合规情况。
v1.0.0
一个面向全网络的 MCP。
v1.0.0
检索 VeChain 文档、查询链上数据并获取手续费建议。
v1.14.0
发送快速问候、抓取网站内容,并按需生成文本或图像。
v0.0.1
查找开源库并按版本获取上下文相关的代码片段。
v1.0.0
远程 MCP server:网页抓取、搜索、Python、TTS、记忆、图像与视频。
当电子表格文件是主要输入或输出时使用本技能。包括:打开、读取、编辑或修复现有 .xlsx、.xlsm、.xltx、.csv、.tsv 文件(如加列、计算公式、格式化、图表、清洗脏数据);从零或其他数据源创建新电子表格;在表格文件格式间转换。当用户按名称或路径引用电子表格文件(哪怕是随口一提,如“下载目录里那个 xlsx”)并要对它做处理或从中产出内容时触发;也适用于把脏乱的表格数据文件(畸形行、错位表头、垃圾数据)整理成规范电子表格。交付物必须是电子表格文件。当主要交付物是 Word 文档、HTML 报告、独立 Python 脚本、数据库流水线或 Google Sheets API 集成时不要触发,即使涉及表格数据。
使用现代前端技术(React、Tailwind CSS、shadcn/ui)创建复杂多组件 claude.ai HTML artifact 的工具集。适用于需要状态管理、路由或 shadcn/ui 组件的复杂 artifact,不适合简单的单文件 HTML/JSX artifact。
为产出物套用主题样式的工具箱。产出物可以是幻灯片、文档、报告、HTML 落地页等。内置 10 套预设主题(配色/字体)可应用于任何已创建的产出物,也可即时生成新主题。
通过 BrowserStack 在真实设备上测试本地或公网 URL、在 Android、iOS 或桌面浏览器上开启实时浏览器会话,或当用户提到 BrowserStack、真机测试、移动测试、跨浏览器测试、触屏测试,或想在特定手机、平板、浏览器版本上验证行为时使用。当用户说「在 Android/iPhone/Safari/Chrome 移动端上测试」、要求开启实时会话,或提及 demo-mobile.html——即使未点名 BrowserStack——也应触发。
**[必备]** 适用于所有 Streamlit 任务:创建、编辑、调试、美化、样式、主题或优化 Streamlit 应用。构建自定义组件(内联或打包)、使用 st.components.v2 或任何 HTML/JS/CSS 组件工作时同样必需。触发词:streamlit、st.、dashboard、app.py、beautify、style、CSS、color、background、theme、button、widget styling、custom component、st.components、packaged component、pyproject.toml、asset_dir、CCv2、HTML/JS component。
Create branded architecture, architecture delta, IT current-state, flowchart, sequence, state machine, ER/data model, timeline, swimlane, quadrant, radar/spider, polar chart (polar/radial lollipop), loop/flywheel, nested, tree, org chart, layer stack, exploded axonometric, axonometric plan, Venn, pyramid/funnel, treemap and marimekko, heatmap, bar and dumbbell, waterfall, line (slopegraph, ridgeline, streamgraph, bump), Gantt and scatter charts (bubble, beeswarm), high-level, process, medallion, data flow, DP integration, DP security matrix, Sankey, fishbone, Wardley map, kanban, user journey, deployment, dependency graph, UML class, story map, or database schema diagrams as HTML/SVG/PNG, with .drawio, Mermaid, and .excalidraw import, plus lifecycle phase maps, block decomposition trees, and onboarding guidance.
用 Docling 理解任意受支持格式文档的内容——PDF(原生数字或扫描件)、DOCX、PPTX、XLSX、HTML、Markdown、AsciiDoc、CSV、图片、音频与 XML——把它们统一转换为 DoclingDocument(Markdown 或结构化 JSON)。当你需要读取、解析、转换、提取或切分无法直接阅读的文档时使用,例如“这份 PDF 里有什么”“转成 markdown”“提取表格”“为 RAG 切块”“读这份扫描文档”“解析这个 DOCX/PPTX”。涵盖 docling CLI、Python SDK(DocumentConverter 与 PipelineOptions)、远程 Service Client(自托管或托管的 docling-serve),以及用于最小依赖体积的 docling-slim install extras。
当裁剪扫描、批量条目编辑或结构调整需要在改动 README.md 之前由维护者审查时,生成交互式保留/删除裁决预览(带逐行反馈控件的 HTML 页面),并处理维护者粘贴回来的反馈 JSON。
使用 firecrawl 与 exa MCP 进行多源深度研究。检索网页、综合发现,并交付带有来源归属的引用报告。在用户需要对任意主题做有证据、有引用的彻底研究时使用。
React 与 Next.js 的无障碍访问模式——语义化 HTML、ARIA 属性、表单标注、键盘导航、焦点管理与读屏软件支持。当构建任何交互式 UI 组件或表单时使用。
用于生成或审计设计系统、检查视觉一致性,并审查涉及样式的 PR。在生成或审计设计系统、检查视觉一致性,或审查样式相关 PR 时使用。
把最近一次成功运行的 /scrape 流程固化为磁盘上的常驻 browser-skill。(gstack)
Use when migrating an existing Meteor app to Rspack (Meteor 3.4+), or upgrading Rspack 1 to 2 on Meteor 3.6 beta. Triggers on nested imports, mainModule entry points, server-only apps, replacing fourseven:scss / meteor/less / coffeescript / jorgenvatle:vite / zodern:melte with loaders, Svelte/TypeScript preprocessing or Lingui SWC plugin failures after upgrade, CommonJS default-import interop, module.exports in client graphs, Node built-ins in browser code, _build / build-assets / build-chunks, .meteorignore hiding handoff files, dynamic chunks under ROOT_URL, meteor.modules for CSS/HTML, resolve.symlinks or resolve.alias migration, automatic dependency updates and immutable CI/Docker builds. Use this skill when the user asks about migration compatibility or a build plugin's Rspack replacement. For new-app setup and rspack.config.js helpers, use meteor-modern-build-stack instead.
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。