Scrapfly 网页抓取
v1.0.0
借助 AI agent 大规模抓取任意网站、提取结构化数据并采集网页内容。
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 1,401 个资源 · 第 13 / 30 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.0
借助 AI agent 大规模抓取任意网站、提取结构化数据并采集网页内容。
v1.12.0
为你的 AI 注入图鉴之力!通过 PokeAPI 轻松获取并探索宝可梦数据。
v1.0.0
从文本或 YouTube 链接秒级生成精美幻灯片。
v1.16.0
跨国际市场按股票代码获取最新可得报价。
v1.16.0
跨全球市场获取指定代码的实时股价与关键数据。可查询如…等公司。
v1.15.0
追踪哔哩哔哩创作者,获取视频、动态与专栏的实时更新。
v1.13.1
从 Frankfurter 获取最新与历史汇率。
快速找到相关的 Smart‑Thinking 记忆。按 ID 获取完整条目以补全上下文。
v1.14.0
按名字问候任何人。
v1.14.0
在工作区中管理 Splitwise 的余额、开销与群组。
v1.13.1
使用 Oxylabs Web Scraper API 获取并处理指定 URL 的内容。
v1.0.0
浏览并管理 Reddit 帖子、评论与讨论串。获取用户动态,探索热门/最新/上升…内容。
v1.0.0
轻松跟踪与浏览 RSS 订阅。从任意订阅地址获取最新条目并提取完整…文本。
Cross-references C# Web API controllers/DTOs against their TypeScript/JavaScript consumers (React, Angular, Vue, Svelte, Node.js, or hand-written/auto-generated HTTP clients like Fetch, Axios, NSwag) to catch contract drift in both directions: backend changes that break client applications (renamed/removed JSON keys, new required parameters, status code shifts) and frontend code sending fields the backend no longer reads. Works directly against source code, not exported OpenAPI spec files. Use when the user asks to check for breaking API changes, verify frontend/backend contract sync, or audit a DTO/controller change against its TypeScript/JS consumers before merging. Not for generating new API code from a spec (see openapi-to-application-code) or scaffolding new endpoints (see aspnet-minimal-api-openapi).
使用 Scrapling 抓取网页,支持反爬绕过(如 Cloudflare Turnstile)、隐身无头浏览、spider 框架、自适应抓取和 JavaScript 渲染。需要抓取/爬取/提取网站数据、web_fetch 失败、站点有反爬防护、编写 Python 抓取代码或 spider 时使用。
为任意库、框架、SDK、CLI 工具或云服务获取最新文档和代码示例。只要用户询问特定库——哪怕 React、Next.js、Prisma、Express、Tailwind、Django、Spring Boot 等常见库——都应使用,因为训练数据可能未反映最近的 API 变更或版本更新。以下情况务必使用:API 语法问题、配置项、版本迁移问题、提到库名的 "how do I" 问题、涉及库特定行为的调试、安装说明,以及 CLI 工具用法。即使你认为自己知道答案也要用——不要依赖训练数据中的 API 细节、函数签名或配置项,它们常常过时。库文档优先于网络搜索。
获取、分析、复现并精简 GitHub issue 的复现步骤。仅在用户要求验证某个 GitHub issue 是否可复现、精简其复现用例、分析 bug 报告,或为可复现性对 issue 做审查/分诊时使用。不适用于没有对应 GitHub issue 的独立复现请求。
通过 Apify actor 抓取社交平台、商业数据与电商内容——Instagram、LinkedIn、TikTok、YouTube、Facebook、Google Maps、Amazon 及通用网页爬取——并在代码中过滤。适用场景:抓取 Instagram/LinkedIn/TikTok/YouTube/Facebook、Google Maps 销售线索、Amazon 评论、商业智能、多平台社媒监听、竞品分析、线索生成、社媒监控、Apify actor、网页爬取、提取联系人。不适用于 X/Twitter 操作(用 _X)、四级代理递进式抓取(用 BrightData)、真实 Chrome 反爬绕过与 computer use(用 Interceptor)。
抓取与 AI 供应商规范 —— Scraper trait 与 SCRAPERS 注册表、选择器容错、限流与任务取消,以及 embeddings/流式输出/提示词所遵循的供应商抽象(零改动切换)规则。在改动 scraping/、ai_provider/、packages/prompts、documents/embed 下的代码时加载。
拉取 GitHub issue,挑选候选项,生成后台修复代理并发起 PR,可选处理 PR 审查评论。
构建本地受限浏览器 agent:safe_browser 工具独占 CDP,通过 Fetch 拦截强制执行域名白名单,让运行时的 Claude Agent SDK agent 完成浏览任务却拿不到原始浏览器、shell 或 CDP 访问权限。当用户希望 agent 只在获批域名内浏览或抓取、演示拦截跨域跳转,或生成一个安全浏览器客户端时使用。
使用 Browserbase CLI(`browse`)完成 Browserbase Functions 与平台 API 工作流。当用户要求运行 `browse`、部署或调用 functions、管理会话/项目/上下文/扩展,通过 Browserbase Fetch API 抓取页面、通过 Browserbase Search API 搜索网页,或搭建起始模板时使用。交互式浏览优先用 Browser 技能;只有用户明确要走 CLI 路径时才使用顶层 `browse` 驱动命令(`browse open`、`browse get` 等)。
通过 agent-browser 实现无头浏览器自动化——Rust CLI 守护进程,带持久化 auth profile,支持快速、可脚本化、并行的浏览器工作。支持批量命令、网络拦截、设备模拟、按站点 auth profile(一次有头登录,此后始终无头)、通过 --session 并行隔离会话。工作流:ReviewStories(将 YAML 用户故事分发到并行 UIReviewer)、Automate(加载并运行参数化 recipe 模板)、Update。通过 agent-browser 指令委派给通用 agent 做后台并行抓取。若站点有 bot 检测则回退到 Interceptor。适用场景:无头浏览器、批量抓取、快速截图、dev server 测试、并行浏览器、后台自动化、提取数据、审查 stories、自动化 recipe、批量截图、并行抓取多页。不适用于真实 Chrome 的部署验证或 UI 确认(用 Interceptor)。不适用于简单单 URL 抓取(用 WebFetch)。不适用于验证码或 bot 检测绕过(用 BrightData 或
通过 Apify actor 抓取社交媒体平台、商业数据与电商内容——Instagram 资料/帖子/话题标签/评论、LinkedIn 资料/职位/帖子、TikTok 资料/话题标签/视频/评论、YouTube 频道/搜索/评论、Facebook 帖子/群组/评论、Google Maps 商家搜索并提取联系方式/评论/图片、Amazon 商品/评论/价格,以及配合自定义 pageFunction 提取逻辑的通用多页网页爬取。基于文件的 TypeScript 封装(scrapeInstagramProfile、searchGoogleMaps、scrapeAmazonProduct、scrapeWebsite 等)在返回模型上下文前于代码中过滤与转换数据,相比直接走 MCP 协议可节省 95-99% 的 token。通过 Promise.all 并行查询多平台,支撑社媒监听看板。线索富化流水线:Google Maps → 合格过滤 → 可选 LinkedIn 富化。可同时在 Instagram、YouTube、TikTok 上做竞品分析。适用场景:抓取 Instagram、抓取 LinkedIn、抓取 TikTok、抓取 YouTube、抓取 Faceboo
通过 agent-browser 实现无头浏览器自动化——Rust CLI 守护进程,带持久化 auth profile,支持快速、可脚本化、并行的浏览器工作。支持批量命令、网络拦截、设备模拟、按站点 auth profile(一次有头登录,此后始终无头)、通过 --session 并行隔离会话。工作流:ReviewStories(将 YAML 用户故事分发到并行 UIReviewer)、Automate(加载并运行参数化 recipe 模板)、Update。通过 agent-browser 指令委派给通用 agent 做后台并行抓取。若站点有 bot 检测则回退到 Interceptor。适用场景:无头浏览器、批量抓取、快速截图、dev server 测试、并行浏览器、后台自动化、提取数据、审查 stories、自动化 recipe、批量截图、并行抓取多页。不适用于真实 Chrome 的部署验证或 UI 确认(用 Interceptor)。不适用于简单单 URL 抓取(用 WebFetch)。不适用于验证码或 bot 检测绕过(用 BrightData 或
通过 Apify actor 抓取社交媒体平台、商业数据与电商内容——Instagram 资料/帖子/话题标签/评论、LinkedIn 资料/职位/帖子、TikTok 资料/话题标签/视频/评论、YouTube 频道/搜索/评论、Facebook 帖子/群组/评论、Google Maps 商家搜索并提取联系方式/评论/图片、Amazon 商品/评论/价格,以及配合自定义 pageFunction 提取逻辑的通用多页网页爬取。基于文件的 TypeScript 封装(scrapeInstagramProfile、searchGoogleMaps、scrapeAmazonProduct、scrapeWebsite 等)在返回模型上下文前于代码中过滤与转换数据,相比直接走 MCP 协议可节省 95-99% 的 token。通过 Promise.all 并行查询多平台,支撑社媒监听看板。线索富化流水线:Google Maps → 合格过滤 → 可选 LinkedIn 富化。可同时在 Instagram、YouTube、TikTok 上做竞品分析。适用场景:抓取 Instagram、抓取 LinkedIn、抓取 TikTok、抓取 YouTube、抓取 Faceboo
拉取当前 Pull Request 上的评审评论并做摘要。
使用 Apify Actor 从多个平台抓取销售线索(leads)。
使用 Apify Actor 抓取多平台的评论、评分与品牌提及。
Windows-MCP 工具的自动化测试技能。只要用户想测试、验证、基准评测或评估任何 Windows-MCP 工具(App、PowerShell、Screenshot、Snapshot、Click、Type、Scroll、Move、Shortcut、Wait、MultiSelect、MultiEdit、Clipboard、Process、Notification、FileSystem、Registry、Scrape)就使用本技能。触发短语如“测试 Click 工具”“基准评测 Screenshot”“验证 FileSystem”“对 Registry 跑 QA”“检查 PowerShell 是否可用”“评估工具性能”,或任何提及测试/验证 Windows-MCP 工具的内容。每次调用只测试一个工具。
从 modelcontextprotocol.io 获取最新的 MCP 规范与文档。训练数据可能过时——只要问题涉及 MCP 协议,默认使用本技能。触发场景:实现或调试 MCP 特性(sampling、elicitation、completion、tools、resources、prompts、传输层);SEP 或规范要求;MCP 传输行为(SSE、Streamable HTTP、重连、重试);授权/OAuth;一致性测试失败;能力协商;消息 Schema。仅在与 MCP 协议零依赖的纯 Kotlin、构建系统或重构任务时跳过。拿不准时就触发
为 Bright Data 构建具备最佳实践的生产级集成,是供使用编码助手(Claude Code、Cursor 等)的开发者参考的文档,用于实现网页抓取、搜索、浏览器自动化与结构化数据提取。覆盖 Web Unlocker API、SERP API、Web Scraper API 与 Browser API(Scraping Browser)。
将交互式 PR 评审走查生成为 HTML 页面。通过 gh API 拉取 PR 数据,把文件归类为核心改动与机械改动,添加评审者标注,并渲染带移动代码检测的 diff。当用户粘贴 GitHub PR 链接并请求评审、走查或摘要,或说“评审这个 PR”时使用。
v1.0.0
浏览器智能控制。自动化操作、截图、填表、数据抓取。
非官方的DeepWiki MCP服务器,通过MCP接收DeepWiki URL,爬取所有相关页面并转换为Markdown格式,可返回单个文档或按页面列表返回
v1.0.0
📰 RSS AI 阅读器 — 自动抓取订阅、LLM生成摘要、多渠道推送! 支持 Claude/OpenAI 生成中文摘要,推送到飞书/Telegram/Email。 触发条件: 用户要求订阅RSS、监控博客、抓取新闻、生成摘要、设置定时抓取、 "帮我订阅"、"监控这个网站"、"每天推送新闻"、RSS/Atom feed 相关。
v1.0.0
使用 agent-browser CLI 进行浏览器自动化。用于签到、填表、截图、信息抓取等需要控制浏览器的任务。触发条件:(1) 用户要求自动化浏览器操作 (2) 需要签到、填表、点击按钮 (3) 需要抓取网页内容作为研究素材
v1.0.0
获取今日热榜,从tophub.today抓取各平台热搜榜单。当用户询问"今天有什么热搜"、"热榜"、"微博热搜"时触发。
v1.0.0
中文AI科技日报自动采集与推送。从The Verge、Wired、TechCrunch等英文源抓取最新AI资讯,自动翻译整理为中文,按分类推送到飞书/Telegram/Discord等渠道。适合关注AI行业动态的中文用户。
v1.0.1
抖音账号视频批量采集与文案分析工作流。当用户提供抖音账号主页链接、要求抓取最新 N 条视频链接、提取视频文案(语音转文字)、或对视频内容进行总结归纳时,激活此 skill。依赖 browser 工具(抓取视频列表)和 mcporter + douyin-mcp(文案提取)。
v8.1.0
基于 Bing 国内版 / DuckDuckGo 的联网搜索工具,中文环境优化,可按需抓取目标网页正文,返回结构化结果。仅在用户明确请求联网搜索时调用。
v1.0.1
打开PC368网站抓取开奖数据,按尾数匹配筛选,排除三重/三连号,统计占比与计算盈亏
v1.0.2
自动读取配置的 RSS 链接,抓取并合并多源报道,去重历史推送,生成无 Emoji、高信息密度的 Markdown 简报。
v1.0.0
抓取微信公众号文章,提取标题和内容并输出为 Markdown 格式。支持多种提取方式。
v1.0.1
财经新闻深度分析技能。从多个财经源抓取内容,进行情感分析(利好/利空/中性)、影响评估(行业/公司/市场)、关键信息提取,生成专业投资简报。支持 A 股/港股/美股、行业板块、个股分析。
v1.0.0
从京东、淘宝、天猫、拼多多等中国电商平台抓取商品价格并进行比较分析。当用户需要比较不同电商平台的商品价格、寻找最佳性价比、或监控商品价格变化时使用。支持关键词搜索、商品链接分析、价格历史追踪和购买建议。
v1.1.1
自动抓取 X/Twitter 关注列表的最新推文,用 AI 分析师提示词生成结构化日报。支持自定义时间段:1 天、3 天、7 天或自定义天数。触发词:“总结关注列表”“X日报”“Twitter摘要”“过去3天的推文”“一周摘要”。前置条件:通过 AUTH_TOKEN 与 CT0 环境变量完成 X 认证。
v1.1.0
中文站能否被豆包/DeepSeek/文心/Kimi 抓取、读懂、引用:可引用性审计、信源池占位探测、五大指标测量、修复计划、观测时序追踪
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。