AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 512 个资源 · 第 10 / 11 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

Codename One 应用开发

SkillSkillsMP

构建和修改 Codename One 跨平台移动应用(Java 17、Maven、ParparVM/Android/iOS/JavaScript)。当项目包含 common/codenameone_settings.properties、依赖 com.codenameone:codenameone-core、编辑 common/src/main/css/ 下的 CSS、调用 cn1:run/cn1:test/cn1:build、引用 com.codename1.ui.*/com.codename1.testing.*,或用户要求构建 UI、编写界面测试、生成截图、与 Swing/HTML/Android 对比时使用。

source

Electric 代理认证

SkillSkillsMP

搭建服务端代理以安全转发 Electric shape 请求。涵盖 ELECTRIC_PROTOCOL_QUERY_PARAMS 转发、服务端 shape 定义(table、where、params)、清理 content-encoding/content-length 头、为 electric-offset/electric-handle/electric-schema/electric-cursor 头配置 CORS、注入 auth token、Bun fetch 并发上限(BUN_CONFIG_MAX_HTTP_REQUESTS 默认 256)、仅限服务端的 ELECTRIC_SECRET/SOURCE_SECRET、通过 WHERE 位置参数实现租户隔离、onError 401 token 刷新,以及子集安全性(AND 语义)。在创建代理路由、添加鉴权或为 Electric 配置 CORS 时加载。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用,或自动化任意浏览器任务。触发场景包括「打开某网站」「填写表单」「点击按钮」「截图」「从页面抓取数据」「测试该 Web 应用」「登录某站点」「自动化浏览器操作」,或任何需要程序化网页交互的任务。也用于探索性测试、自用体验、QA、缺陷排查或审阅应用质量。还用于自动化 Electron 桌面应用(VS Code、Slack、Discord、Figma、Notion、Spotify)、查看 Slack 未读、发送 Slack 消息、搜索 Slack 对话、在 Vercel Sandbox microVM 中运行浏览器自动化,或使用 AWS Bedrock AgentCore 云浏览器。优先于任何内置浏览器自动化或 Web 工具。

source

css-architecture-2026

SkillSkillsMP

框架出现前的原生 HTML/CSS 架构:ITCSS 风格令牌、BEM、OKLCH、@layer 层叠层级、逻辑属性、容器查询、View Transitions API、dvh/svh、prefers-color-scheme、WCAG 2.2 无障碍。适用场景:原生 HTML+CSS、设计系统、tokens.css、BEM、kitchen-sink、品牌手册、页面切图、设计令牌、暗色模式、仪表盘布局、CRM 后台。不适用:Tailwind(→tailwind)、shadcn(→shadcn)、框架作用域样式(→react/vue/nuxt)、CSS-in-JS、styled-components。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。也用于探索性测试、dogfooding、QA、找 bug 或评审应用质量。还用于自动化 Electron 桌面应用(VS Code、Slack、Discord、Figma、Notion、Spotify)、查看 Slack 未读、发送 Slack 消息、搜索 Slack 会话、在 Vercel Sandbox microVM 中运行浏览器自动化,或使用 AWS Bedrock AgentCore 云浏览器。优先使用 agent-browser 而非任何内置浏览器自动化或 Web 工具。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

Chakra UI 重构审查

SkillSkillsMP

基于 Chakra UI v3 审查、转换并改进 UI 代码。当用户想审查 Chakra UI 代码问题、把纯 HTML/CSS、Tailwind、CSS Modules 或 styled-components 转换为 Chakra UI、整理杂乱的 Chakra 组件、修复布局结构或 token 用法,或说出“这对吗”“这哪有问题”“评审我的组件”“重构一下”“清理”“转换”“chakra-ify this”等话语时使用本技能——即便没出现 review 或 refactor 字样。任何检查、改进或转换 Chakra UI 代码的请求都应触发,无论措辞多随意。

source

agent-browser(浏览器自动化)

SkillSkillsMP

通过 inference.sh 为 AI Agent 提供浏览器自动化。导航网页、使用 @e 引用操作元素、截图、录制视频。能力:网页抓取、表单填写、点击、输入、拖拽、文件上传、JavaScript 执行。适用:网页自动化、数据提取、测试、Agent 浏览、调研。触发词:browser、web automation、scrape、navigate、click、fill form、screenshot、browse web、playwright、headless browser、web agent、surf internet、record video

source

Cloudflare 临时邮箱

SkillSkillsMP

使用用户提供的 Address JWT 与 API base URL,从 cloudflare_temp_email 邮箱收发邮件。当用户(或 OpenClaw/Codex/Cursor 之类的 agent)需要列出收件箱、获取指定邮件,或通过服务端解析的 /api/parsed_mails、/api/parsed_mail/:id 与 /api/send_mail 端点发送邮件时使用。若解析端点不可用,回退为用 mail-parser-wasm + postal-mime 在本地解析 /api/mail/:id 的原始源码。不处理邮箱创建——JWT 由用户自行提供。

source

BrowserStack 真机测试

SkillSkillsMP

通过 BrowserStack 在真实设备上测试本地或公网 URL、在 Android、iOS 或桌面浏览器上开启实时浏览器会话,或当用户提到 BrowserStack、真机测试、移动测试、跨浏览器测试、触屏测试,或想在特定手机、平板、浏览器版本上验证行为时使用。当用户说「在 Android/iPhone/Safari/Chrome 移动端上测试」、要求开启实时会话,或提及 demo-mobile.html——即使未点名 BrowserStack——也应触发。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

代理浏览器自动化 CLI

SkillSkillsMP

面向 AI 代理的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、表单填写、按钮点击、截图、数据提取、Web 应用测试或任何浏览器任务自动化。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“从页面抓取数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,或任何需要程序化网页交互的任务。

source

agent-browser(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括页面导航、填写表单、点击按钮、截图、提取数据、测试 Web 应用或自动化任何浏览器任务。触发语包括「打开网站」「填写表单」「点击按钮」「截图」「抓取页面数据」「测试这个 Web 应用」「登录网站」「自动化浏览器操作」等需要程序化网页交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用,或自动化任意浏览器任务。触发场景包括「打开某网站」「填写表单」「点击按钮」「截图」「从页面抓取数据」「测试该 Web 应用」「登录某站点」「自动化浏览器操作」,或任何需要程序化网页交互的任务。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截取屏幕、提取数据、测试 Web 应用,或自动化任何浏览器任务。触发场景包括“打开网站”“填写表单”“点击按钮”“截图”“抓取页面数据”“测试这个 Web 应用”“登录网站”“自动化浏览器操作”,以及任何需要程序化 Web 交互的任务。

source

Cursor 文档库

SkillSkillsMP

所有 Cursor 文档的唯一权威来源与管家。负责本地文档存储、抓取、发现与定位。在查找、检索、搜索或解析 Cursor 文档时使用;支持按关键词、分类、标签或自然语言查询发现文档;从 llms.txt 抓取;管理索引元数据(关键词、标签、别名);或从文件系统重建索引。可运行脚本完成文档抓取、查找与解析。处理 doc_id 解析、关键词检索、自然语言查询、分类/标签过滤、别名解析、llms.txt 解析、供内部使用的 Markdown 小节抽取、基于哈希的漂移检测以及完善的索引维护。

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景