AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 25 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →
xlsx icon

xlsx

SkillGitHub

当电子表格文件是主要输入或输出时使用本技能。包括:打开、读取、编辑或修复现有 .xlsx、.xlsm、.xltx、.csv、.tsv 文件(如加列、计算公式、格式化、图表、清洗脏数据);从零或其他数据源创建新电子表格;在表格文件格式间转换。当用户按名称或路径引用电子表格文件(哪怕是随口一提,如“下载目录里那个 xlsx”)并要对它做处理或从中产出内容时触发;也适用于把脏乱的表格数据文件(畸形行、错位表头、垃圾数据)整理成规范电子表格。交付物必须是电子表格文件。当主要交付物是 Word 文档、HTML 报告、独立 Python 脚本、数据库流水线或 Google Sheets API 集成时不要触发,即使涉及表格数据。

sourceregistry 收录

BrowserStack 真机测试

SkillSkillsMP

通过 BrowserStack 在真实设备上测试本地或公网 URL、在 Android、iOS 或桌面浏览器上开启实时浏览器会话,或当用户提到 BrowserStack、真机测试、移动测试、跨浏览器测试、触屏测试,或想在特定手机、平板、浏览器版本上验证行为时使用。当用户说「在 Android/iPhone/Safari/Chrome 移动端上测试」、要求开启实时会话,或提及 demo-mobile.html——即使未点名 BrowserStack——也应触发。

source

developing-with-streamlit(Streamlit 应用开发)

SkillSkillsMP

**[必备]** 适用于所有 Streamlit 任务:创建、编辑、调试、美化、样式、主题或优化 Streamlit 应用。构建自定义组件(内联或打包)、使用 st.components.v2 或任何 HTML/JS/CSS 组件工作时同样必需。触发词:streamlit、st.、dashboard、app.py、beautify、style、CSS、color、background、theme、button、widget styling、custom component、st.components、packaged component、pyproject.toml、asset_dir、CCv2、HTML/JS component。

source

diagram-design

SkillSkillsMP

Create branded architecture, architecture delta, IT current-state, flowchart, sequence, state machine, ER/data model, timeline, swimlane, quadrant, radar/spider, polar chart (polar/radial lollipop), loop/flywheel, nested, tree, org chart, layer stack, exploded axonometric, axonometric plan, Venn, pyramid/funnel, treemap and marimekko, heatmap, bar and dumbbell, waterfall, line (slopegraph, ridgeline, streamgraph, bump), Gantt and scatter charts (bubble, beeswarm), high-level, process, medallion, data flow, DP integration, DP security matrix, Sankey, fishbone, Wardley map, kanban, user journey, deployment, dependency graph, UML class, story map, or database schema diagrams as HTML/SVG/PNG, with .drawio, Mermaid, and .excalidraw import, plus lifecycle phase maps, block decomposition trees, and onboarding guidance.

source

Docling 文档解析 docling

SkillSkillsMP

用 Docling 理解任意受支持格式文档的内容——PDF(原生数字或扫描件)、DOCX、PPTX、XLSX、HTML、Markdown、AsciiDoc、CSV、图片、音频与 XML——把它们统一转换为 DoclingDocument(Markdown 或结构化 JSON)。当你需要读取、解析、转换、提取或切分无法直接阅读的文档时使用,例如“这份 PDF 里有什么”“转成 markdown”“提取表格”“为 RAG 切块”“读这份扫描文档”“解析这个 DOCX/PPTX”。涵盖 docling CLI、Python SDK(DocumentConverter 与 PipelineOptions)、远程 Service Client(自托管或托管的 docling-serve),以及用于最小依赖体积的 docling-slim install extras。

source

migrate-to-rspack

SkillSkillsMP

Use when migrating an existing Meteor app to Rspack (Meteor 3.4+), or upgrading Rspack 1 to 2 on Meteor 3.6 beta. Triggers on nested imports, mainModule entry points, server-only apps, replacing fourseven:scss / meteor/less / coffeescript / jorgenvatle:vite / zodern:melte with loaders, Svelte/TypeScript preprocessing or Lingui SWC plugin failures after upgrade, CommonJS default-import interop, module.exports in client graphs, Node built-ins in browser code, _build / build-assets / build-chunks, .meteorignore hiding handoff files, dynamic chunks under ROOT_URL, meteor.modules for CSS/HTML, resolve.symlinks or resolve.alias migration, automatic dependency updates and immutable CI/Docker builds. Use this skill when the user asks about migration compatibility or a build plugin's Rspack replacement. For new-app setup and rspack.config.js helpers, use meteor-modern-build-stack instead.

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景