Refetch 网页抓取
v1.0.0
以 Markdown 抓取网页、搜索网页与新闻、抽取结构化数据,供 AI 智能体使用。
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 1,401 个资源 · 第 8 / 30 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.0
以 Markdown 抓取网页、搜索网页与新闻、抽取结构化数据,供 AI 智能体使用。
v1.0.0
监控网页变化,提供 AI 驱动的变化检测、差异对比与提醒。
v1.0.0
抓取 URL 并返回带元数据的干净 Markdown,无需 API key,按 IP 限速。
v1.0.0
网页抓取 MCP 服务器:URL、链接、元数据与 CSS 提取。
v2.3.0
Rust MCP 隐蔽抓取器:具备反爬搜索/抓取、CDP 回退与 HITL 非机器人验证。
v2.0.0-rc
隐蔽抓取与搜索,通过 Cyborg HITL 方式绕过 Cloudflare、DataDome 与 LinkedIn。
v1.0.1
通过 ScrapeGraph API 提供 AI 驱动的网页抓取与数据提取能力。
v2.0.1
使用 Crawlee 抓取并分析网站的 SEO 错误,结果存储于 SQLite。
v1.0.0
托管版 Crawleo MCP(远程可流式 HTTP 端点)。
v1.0.2
智能网页内容抓取 MCP 服务器,将 HTML 转换为干净、AI 可读的 JSONL 格式。
v1.0.4
从网页抓取内容并整理成适合 LLM 的精净文本(基于 Defuddle)。
v0.3.0
将 HTML 转换为 Markdown,自动摘要并按章节抽取,支持 Playwright。
v1.16.0
让语言模型以企业级可靠性执行高级 AI 网页抓取。
v1.0.0
一个向网页发起 fetch 请求的简单工具。
v1.0.0
抓取网页并精准提取你所需的内容。
v1.15.0
将网页提取并解析为干净的 HTML、链接或 Markdown。
v0.1.1
用于网页内容抓取、摘要、对比与信息提取的 MCP 服务器。
v1.0.0
提供从网页抓取、转换和提取数据工具的 MCP 服务器。
设计收尾:生成贴近生产质量、原生支持 Pretext 的 HTML/CSS。(gstack)
在 Next.js 应用中开启 Partial Prefetching 并消化其给出的洞察。当用户要启用或接入 Partial Prefetching、切换 partialPrefetching 标志、用 export const prefetch = 'partial' 让路由接入、审计 Link prefetch={true} 行为、用 instant() 测试保护已预取的 UI,或解决 instant-link-prefetch-partial 与 instant-shell-url-data 洞察时使用。
Optimize what selected Next.js client navigations include before the click under Partial Prefetching. Use after Cache Components and Partial Prefetching are adopted when the user wants selected URL-specific UI to be instant, wants reusable content to wait for navigation, or needs to choose between default, viewport, and intent prefetching. Requires Next.js 16.3+.
用语义化 HTML、CSS 和直接的浏览器 API 编写 PostHog canvas——文档、文章、生成式图形、2D canvas 与 WebGL 体验,以及 React 组件不能提供有效结构的聚焦实验。在 building-canvases 把画布请求路由到纯 HTML/浏览器 API 实现之后使用。涵盖当前运行时要求的轻量组件包装、不依赖 Quill 的样式与主题、绘图画布,以及动画/清理模式。
按 ISO 3166-1 alpha-2 国家代码,获取当前的 AI 生成战略情报简报。当用户询问某国当前地缘政治、经济或安全局势摘要时使用。
为 Discourse 核心、插件、主题与主题组件编写和修复 HTML/CSS/SCSS。在编写或修改模板(.gjs/.hbs)、样式表(.scss)、组件标记、类名、响应式布局、FormKit/select-kit 样式或处理 CSS 回归时使用。涵盖 Discourse 的 BEM 加独立修饰符命名、CSS 自定义属性色彩体系(主题化与暗色模式)、模板/HTML 约定、CSS 修复模式,以及样式表的存放位置。
使用 `html-diff` 测试装置在所有预览页上证明重构不改变渲染 HTML。在任何应当输出中性的改动前后使用——抽取或重命名组件、用 `shared/ui` 组件替换手写标记、调整属性顺序、重构布局、迁移 SCSS 类生成逻辑——以及当用户询问改动是否安全或字节级一致时。涵盖基线采集、diff 阅读,以及何为可接受的差异。
为任意公开来源(招聘网站、价格、新闻、GitHub、体育赛事等)构建全自动的 AI 数据收集代理。按计划抓取,用免费 LLM(Gemini Flash)丰富数据,将结果存入 Notion/Sheets/Supabase,并从用户反馈中学习。完全免费地在 GitHub Actions 上运行。当用户希望自动监控、收集或追踪公开数据时使用。
OpenDesign 在 GitHub、Discord 与 X 上的社区增长战役:增长闭环、内容日历与漏斗数学。以面向增长团队与社区负责人的决策级营销 & GTM 幻灯片构建。
OpenDesign 在 GitHub、Discord 与 X 上的社区增长战役:增长闭环、内容日历与漏斗数学。以面向增长团队与社区负责人的决策级营销 & GTM 幻灯片构建。
产品经理的年终自我复盘——职责、成果、成长与诉求,全部有证据支撑。以面向上级与评审委员会的决策级职业幻灯片构建。
OpenDesign 的企业级 AI 采纳简报:本地优先的工作代理、风险控制、ROI 与落地计划。以面向管理层、IT 与安全的决策级 AI 素养幻灯片构建。
OpenDesign 的企业级 AI 采纳简报:本地优先的工作代理、风险控制、ROI 与落地计划。以面向管理层、IT 与安全的决策级 AI 素养幻灯片构建。
面向全体员工的 IT 安全意识培训——识别钓鱼邮件的征兆、演练与最初 60 秒该做什么。以决策级专业培训幻灯片形式构建。
将 python-pptx 导出结果与其源 HTML 演示文稿对照审查,识别布局/内容偏差(页脚溢出、内容裁切、缺失斜体/强调、样式丢失、节奏失衡的间距),并以严格的页脚导轨 + 光标流布局纪律重新导出。当用户的 .pptx 由 HTML 幻灯片生成并要求比较/审查/验证/修复导出时使用——包括「compare ppt with html」「fidelity audit」「fix the pptx」「ppt is cut off」「footer overlap」「italic missing in pptx」「re-export the deck」「pptx-html-fidelity-audit」等说法,或任何需要验证/修复 python-pptx 与 HTML 往返转换的场景。当用户并排展示 deck.html 与 deck.pptx 并调试视觉差异时也应触发。
将 python-pptx 导出结果与其源 HTML 演示文稿对照审查,识别布局/内容偏差(页脚溢出、内容裁切、缺失斜体/强调、样式丢失、节奏失衡的间距),并以严格的页脚导轨 + 光标流布局纪律重新导出。当用户的 .pptx 由 HTML 幻灯片生成并要求比较/审查/验证/修复导出时使用——包括「compare ppt with html」「fidelity audit」「fix the pptx」「ppt is cut off」「footer overlap」「italic missing in pptx」「re-export the deck」「pptx-html-fidelity-audit」等说法,或任何需要验证/修复 python-pptx 与 HTML 往返转换的场景。当用户并排展示 deck.html 与 deck.pptx 并调试视觉差异时也应触发。
vdevelop
在 Next.js 中实现 Fetch API、缓存与再验证(revalidation)策略。用于获取数据、配置缓存行为或在 Next.js 中实现再验证。
产品经理的年终自我复盘——职责、成果、成长与诉求,全部有证据支撑。以面向上级与评审委员会的决策级职业幻灯片构建。
面向全体员工的 IT 安全意识培训——识别钓鱼邮件的征兆、演练与最初 60 秒该做什么。以决策级专业培训幻灯片形式构建。
将杂乱或 AI 生成的爬虫代码重写为符合 zavod 最佳实践的整洁、生产级代码。当用户要求清理、重构、整理爬虫代码、“达到生产可用”或对齐最佳实践时使用。
按 ISO 3166-1 alpha-2 国家代码,获取当前的 AI 生成战略情报简报。当用户询问某国当前地缘政治、经济或安全局势摘要时使用。
将 PDF 转换为单个自包含、可读性好的 HTML 文件,保留图片、表格、图表和阅读顺序——还可选择翻译为另一种语言同时保留全部图形。使用结构化抽取(PyMuPDF)、基于字号的版式推断、压缩的 base64 内联图片(单一可携带文件),以及强制的无头 Chrome 视觉校验。当有人想把 PDF 作为网页或干净文档来阅读、把 PDF 转成 HTML,或在保留图/表/图表的前提下翻译 PDF 时使用——例如“PDF 转 HTML”“把这个 PDF 转成中文网页版”“让这份报告变得可读”“翻译这份 PDF 但别丢图表”“我只想在手机上读这份 PDF”。与 doc-to-markdown(纯 Markdown 文本)和 pdf-creator(Markdown→PDF)不同——本技能产出带样式、忠实还原图片的 HTML 阅读体验。
审查与“使用语义化 HTML 元素”相关的模板、渲染 HTML 或共享组件时使用。校验最终面向浏览器的标记,而不只是框架侧的源码抽象。
审查与“添加资源提示(preload、prefetch、dns-prefetch)”相关的模板、渲染 HTML 或共享组件时使用。校验最终面向浏览器的标记,而不只是框架侧的源码抽象。
审查服务端渲染配置、Next.js App Router 页面或 Node.js HTTP handler,确认 HTML 是增量流式输出而非缓冲到完成再发送时使用。
将 Firecrawl 集成部署到 Vercel、Cloud Run 与 Docker。用于把 Firecrawl 驱动的应用部署到生产、配置平台密钥或自建 Firecrawl。触发语如 “deploy firecrawl”、“firecrawl Vercel”、“firecrawl production deploy”、“firecrawl Cloud Run”、“firecrawl Docker”。
Slack 归档:搜索、同步新鲜度、线程/私信、SQL 统计,以及 Slacrawl 仓库相关工作。
Granola 归档:搜索、同步新鲜度、笔记、会议记录、面板、SQL 统计,以及 Graincrawl 仓库相关工作。
Notion 归档:搜索、同步新鲜度、页面/数据库、Markdown 导出、SQL 统计,以及 Notcrawl 仓库相关工作。
GitHub 归档:issue/PR 搜索、同步新鲜度、重复聚类、gh-shim PR 状态,以及 Gitcrawl 仓库相关工作。
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。