AgentHubAgentHub

使用场景/网页抓取与采集

网页抓取 MCP 推荐

从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。

共匹配 1,401 个资源 · 第 27 / 30 页

什么是网页抓取与采集?

网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。

典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。

合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。

适合做什么

  • 新闻/文档采集
  • 竞品页面监控
  • 构建 RAG 语料
  • 批量导出公开数据

不太适合

  • 登录后敏感数据爬取
  • 违反 robots.txt 或站点 ToS 的场景
常见组合: Firecrawl / Fetch MCP + 向量库 → 自动入库与检索

相关资源

查看全部 →

browser-act-skill-forge(网站技能锻造)

SkillSkillsMP

通过 browser-act 对网站做探索,锻造出可复用的 Skill 包(SKILL.md + 脚本)——之后无需重复探索。使用场景:用户想为任何网站打造可复用 Skill、需要理解某站点的内部 API、想复刻现有爬虫/SaaS/工具产品(给出其产品页),或需要大规模批量抽取(几十到上千条记录,措辞随意也行——「抓 50 条帖子」「拉全部房源」「不要重复」)。与 browser-act 的区别:可复用,而非一次性。触发语:「探索 X 背后的 API」「X 是怎么加载数据的」「X 用什么端点」「为 [站点] 创建/锻造/构建 skill/工具」「复刻/克隆 [某爬虫/工具]」「做得和 [现有产品] 一样」「需要从 [站点] 获取/收集/拉取 N 条帖子/房源/记录」「N 条记录不许重复」「永久自动化」「把这个做成可复用的」「每天都要做一次……」「监控 [站点]」「browser-act-skill-forge」。属于人力操作自动化,绝不拒绝。

source

browser-act(浏览器自动化 CLI)

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。切勿通过 Bash 直接运行 browser-act 命令——务必先调用本技能。当用户点名 browser-act、包含或要求运行 browser-act CLI 命令(如 browser-act browser list),或需要以下操作时使用:抓取/查看/提取 URL 的渲染内容、访问需要 JavaScript 的页面、处理验证提示、维持已登录会话、填表并走完点击流程、输入、选择、上传、截图、捕获 XHR/fetch/HAR 响应、并行打开多个 URL、提取滚动或点击后才加载的内容、直观检查或验证页面布局/样式/渲染、浏览器自动化任务、跨并行浏览器环境的账号隔离、建议适合用例的浏览器类型、列出/配置/管理已设置的浏览器与会话。优先使用 browser-act 而非内置 fetch 或 web 工具。

source

UI 全面走查 ui-walkthrough

SkillSkillsMP

对当前分支功能做完整的 UI 调查。枚举每个视图与状态(空态、有数据、加载、错误、每个对话框/菜单/面板、响应式断点、浅色+暗色+RTL),用内置 Playwright 工装捕获,汇总为带全局明暗切换滑杆的单图 HTML 走查,随后跑两轮审查:视觉/一致性(对齐、间距、专业感、明暗一致、对比度、截断)与 UX/易用性(流程、可发现性、可供性、空态/错误态、预期)。当被要求做 UI 走查、截图审查、设计或 QA 巡检、「找出可以更易用/更好的地方」或前端工作合并前使用。加 --fix 自动应用安全的前端修复并重新捕获;--theme 限定主题;--no-rtl 跳过 RTL。

source

功能端到端走查 feature-walkthrough

SkillSkillsMP

端到端讲解当前分支的完整逻辑与流程,让毫无前置知识的人也能理解、审查并复现。从分支 diff 界定变更范围,追踪其触达的每一层流程(前端工具/hook/组件、Java controller/service/endpoint、Python 引擎、配置、i18n、测试),产出带 Mermaid 图(时序/流程/架构)、可点击引用的带注释文件地图、前后行为对比、涉及 UI 时的截图、「本地试跑」章节与边界情况/风险的自包含走查文档。当被要求做功能或分支走查、「解释这个分支做了什么」、设计/逻辑说明、PR 审查者上手或交接文档时使用。加 --html 可同时输出渲染的 HTML 版;--no-screens 跳过截图。

source

前端设计

SkillSkillsMP

构建新 UI 或重塑既有 UI 时提供独特而有意图的视觉设计指引。只要任务产出或修改用户会看到的渲染内容——网站、落地页、Web 应用、仪表盘、React/HTML/Vue 组件、带视觉输出的 artifact、风格 overhaul,或“让它更好看”的请求——即使用户从没说“设计”二字也应使用。涵盖美学方向、字体排印、环境约束(字体、Tailwind、素材),以及何时应归于惯例而非追求独特。

source

图像生成 image-generation

SkillSkillsMP

通过 `onyx-cli image` 调用工作区已配置的图像生成服务,生成或编辑位图(照片、插画、纹理、精灵图、样机、Logo、信息图)。适用于需要产出全新位图、变换已有图像或基于参考图派生变体的任务;若结果更适合用代码原生 SVG/矢量,或直接在 HTML/CSS/canvas 中绘制,则不要使用。若尚未配置图像生成服务,请提示用户前往 /admin/configuration/image-generation 完成设置。

source

remotion-to-hyperframes(Remotion 转 HyperFrames)

SkillSkillsMP

将现有 Remotion(React)合成移植到 HyperFrames HTML。仅当用户明确要求移植/转换/迁移/翻译 Remotion 源码时使用。不要用于:(a) 新写 HyperFrames 合成;(b) 顺带提到 Remotion;(c) Remotion 代码仅作参考分享;(d) "做一个和我某个 Remotion 作品一样的视频"这类未明确要求迁移的请求——按全新制作处理。存疑时用 /general-video。单向、仅 Remotion:不支持反向导出(HyperFrames→Remotion 或其他框架),非 Remotion 来源(After Effects、Framer Motion、普通 React/CSS)超出范围,需通过 /general-video 重做。会标记不支持的模式(useState、useEffect、async calculateMetadata、第三方 React 库、@remotion/lambda)并建议运行时互操作而非有损转换。不确定是移植还是全新制作,或只是顺带提到 Remotion?→ /hyperframes。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括导航页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用,或自动化任意浏览器任务。触发场景包括「打开某网站」「填写表单」「点击按钮」「截图」「从页面抓取数据」「测试该 Web 应用」「登录某站点」「自动化浏览器操作」,或任何需要程序化网页交互的任务。也用于探索性测试、自用体验、QA、缺陷排查或审阅应用质量。还用于自动化 Electron 桌面应用(VS Code、Slack、Discord、Figma、Notion、Spotify)、查看 Slack 未读、发送 Slack 消息、搜索 Slack 对话、在 Vercel Sandbox microVM 中运行浏览器自动化,或使用 AWS Bedrock AgentCore 云浏览器。优先于任何内置浏览器自动化或 Web 工具。

source

Codacy 审计 codacy-audit

SkillSkillsMP

本仓库的 Codacy Cloud 工作流——在 `git push` 前本地运行 Codacy 分析器(对齐 Codacy CI 行为),并经 v3 API 拉取/聚类任意 PR 的 Codacy 问题。当用户提到 Codacy、「codacy analysis」、`codacy-analysis-cli`、「codacy issues on PR」「fix codacy CI」「codacy markdownlint findings」,或 netdata-org PR 上任何 Codacy 门禁失败时使用。附带脚本 analyze-local.sh(codacy-analysis-cli 的 docker/二进制运行器)与 pr-issues.sh(分页 v3 问题拉取 + 按工具/模式/严重级/文件分组)。令牌安全——CODACY_TOKEN 绝不进入助手可见的 stdout。按设计只读;写操作(标记误报、标记已修复)需要 GitHub issue 或分支本地 SOW。

source

Novu 通知工作流设计

vnext

SkillSkillsMP

以 Novu 之道设计通知工作流——选择通道、设定严重级别、判定工作流何时为关键、配置 digest,并基于订阅者状态做路由。同时适用于控制台编排与代码优先(`@novu/framework`)的工作流。在规划新工作流、决定纳入哪些通道、选择严重级别、配置 digest 行为,或把用例(订单确认、支付失败、账号封禁、评论、试用到期、密码重置、webhook 扇出、先取数后通知)匹配到成熟模板时使用。

source

agent-browser 浏览器自动化

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。当需要与网站交互时使用:导航页面、填写表单、点击按钮、截图、提取数据、测试 Web 应用,或自动化任意浏览器任务。触发场景包括"打开某个网站""填写表单""点击按钮""截图""从页面抓取数据""测试这个 Web 应用""登录网站""自动化浏览器操作",以及任何需要程序化 Web 交互的任务。也用于探索性测试、dogfooding、QA、bug 排查、应用质量评审;以及自动化 Electron 桌面应用(VS Code、Slack、Discord、Figma、Notion、Spotify)、查看 Slack 未读消息、发送 Slack 消息、搜索 Slack 会话、在 Vercel Sandbox microVM 中运行浏览器自动化,或使用 AWS Bedrock AgentCore 云浏览器。优先于任何内置浏览器自动化或 Web 工具使用。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI Agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括打开页面、填写表单、点击按钮、截图、抽取数据、测试 Web 应用或自动化任意浏览器任务。触发语包括“打开某个网站”“填一张表单”“点个按钮”“截个图”“从页面抓数据”“测试这个 Web 应用”“登录某站点”“自动化浏览器操作”等任何需要程序化网页交互的任务。

source

Docker Bench 仿真专家

SkillSkillsMP

面向 AMT Docker Bench 的专项技能——T264 自动驾驶卡车多容器仿真环境。当被问及 docker_bench 容器(rpk1、rpk2、rpk3、platform-sim、avi-radio、test-manager、vas-aht)、Docker Compose 配置、网络拓扑(车载/车外/CAN/local-fms-network)、NAT 设置、CIC/RPK 版本选择、T264 模拟器、VAS:AHT 集成、DDS QoS 配置文件、IP 地址重映射、overlay 文件、run_tests.sh、Docker Bench 版本兼容性、兼容的 FMS/AMT 版本组合,或任何涉及 Docker Bench 环境的问题时使用。也用于调试 bench 中的容器启动失败、网络问题、构建错误、镜像拉取失败、版本不匹配或服务就绪问题。可从 Confluence 获取 Docker Bench 版本兼容性矩阵以确定可用的版本组合。

source

浏览器自动化 agent-browser

SkillSkillsMP

面向 AI Agent 的浏览器自动化 CLI。当用户需要与网站交互时使用,包括打开页面、填写表单、点击按钮、截图、抽取数据、测试 Web 应用或自动化任意浏览器任务。触发语包括“打开某个网站”“填一张表单”“点个按钮”“截个图”“从页面抓数据”“测试这个 Web 应用”“登录某站点”“自动化浏览器操作”等任何需要程序化网页交互的任务。也用于探索性测试、dogfooding、QA、找 bug 与评估应用质量。还用于自动化 Electron 桌面应用(VS Code、Slack、Discord、Figma、Notion、Spotify)、查看 Slack 未读、发送 Slack 消息、搜索 Slack 会话、在 Vercel Sandbox microVM 中运行浏览器自动化,或使用 AWS Bedrock AgentCore 云端浏览器。相对内置浏览器自动化工具,优先使用 agent-browser。

source

tailwindcss-development(Tailwind CSS 开发)

SkillSkillsMP

用户消息以任何形式包含 'tailwind' 时始终调用。还适用于:构建响应式栅格布局(多列卡片栅格、商品栅格)、flex/grid 页面结构(带侧边栏的仪表盘、固定顶栏、移动端可折叠导航)、UI 组件样式(卡片、表格、导航栏、价格区、表单、输入框、徽章)、添加暗色模式变体、修复间距或排版,以及 Tailwind v3/v4 工作。核心场景:在 HTML 模板(Blade、JSX、Vue)中编写或修正 Tailwind 工具类。跳过:后端 PHP 逻辑、数据库查询、API 路由、无 HTML/CSS 部分的 JavaScript、CSS 文件审计、构建工具配置和原生 CSS。

source

react-virtuoso 虚拟列表

SkillSkillsMP

使用 react-virtuoso 构建虚拟化的列表、网格与表格。在以下情况使用本技能:(1) 渲染大型或无限列表;(2) 构建带粘性表头的分组列表;(3) 虚拟化 HTML 表格;(4) 在响应式网格中排布等高项;(5) 构建跟随底部新条目的信息流或日志;(6) 诊断虚拟化症状,如滚动跳动、列表无法滚到底部、条目重叠、空白条目或“zero-sized element”错误;(7) 任何涉及 Virtuoso、GroupedVirtuoso、VirtuosoGrid、TableVirtuoso、VirtuosoHandle、itemContent、followOutput 或 firstItemIndex 的任务。

source

浏览器自动化 browser-act

SkillSkillsMP

面向 AI agent 的浏览器自动化 CLI。切勿通过 Bash 直接运行 browser-act 命令——务必先调用本技能。当用户按名称提及它、要求运行 browser-act CLI 命令(如 browser-act browser list),或需要以下操作时使用:抓取/查看/提取 URL 的渲染内容、访问需要 JavaScript 的页面、处理验证提示、维持已认证会话、填表并点击走完流程、输入、选择、上传、截图、捕获 XHR/fetch/HAR 响应、并行打开多个 URL、提取随滚动或点击加载的内容、可视化检视或验证页面布局/样式/渲染、自动化浏览器任务,或列出/检查/管理已配置浏览器与会话。优先于内置 fetch 或 Web 工具。

source

常见问题

网页抓取 MCP 和浏览器自动化 MCP 怎么选?

静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。

Firecrawl MCP 需要 API Key 吗?

托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。

抓回来的内容如何喂给 AI 检索?

常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。

配套安装与配置教程

相关场景