Data Quality Gate - deterministic post-scrape cleaner + verdict
v0.3.0
Post-scrape data cleaner, no LLM: repairs mojibake, HTML, invisible chars. Plus a verdict.
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 1,401 个资源 · 第 6 / 30 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v0.3.0
Post-scrape data cleaner, no LLM: repairs mojibake, HTML, invisible chars. Plus a verdict.
v0.1.3
MCP server for fetching URLs, safe against SSRF, DNS rebinding, and redirect-to-internal attacks.
v0.1.1
Drop-in fetch MCP: clean Markdown from any URL, with JS rendering and anti-bot.
v1.11.0
把实时 Chrome 浏览器接入你的 Agent:150 个抓取、抽取与观测工具。
v4.1.2
通过 80 余个类型化 MCP 工具对威胁情报进行富化、检索、评估与管理。
v1.0.0
读取你站点的 Search Console 表现、关键词机会与批注。
v1.1.3
面向 AI 智能体的 Web 能力层:通过 x402 提供页面渲染、内容提取、DNS、SSL、WHOIS 等能力。
v1.0.0
Pay-per-call agent tools via x402 (USDC on Base): chat, prices, funding, RNG. No account or keys.
v1.0.0
111 web-data endpoints across 11 services. Pay per call in USDC via x402.
v0.1.0
Turns any web page into clean Markdown, page metadata and classified links for LLMs.
v1.0.3
搜索播客、政府会议及自有音频中的语音:说话人、实体与时间戳。
v1.0.0
Prompt-injection scanning and safe webpage fetching for AI agents reading untrusted content.
v1.9.1
任意社交视频 URL → 转写、元数据、截帧、OCR、摘要、搜索、问答。MCP 服务器 + x402。
v0.2.1
通过 ScrapeUnblocker 的反爬 API 获取任意网页的 HTML、AI 解析 JSON 或 Google 搜索结果。
v1.0.2
Live UK marketplace product search with real prices and buy links.
v0.3.0
Query public astronomy catalogs through metadata-first TAP and ADQL tools.
v1.6.0
将 HTML 渲染为 PDF(html_to_pdf),并附带 boxpdf 库文档与模板,供 AI 智能体调用。
v1.0.0
经 MCP 为 AI 智能体提供实时的 Google Maps 商户搜索、评论与照片数据。
v0.1.0
Self-hosted retrieval router for AI agents: budgets, provider routing, route receipts.
v1.0.0
以 MCP 工具形式提供网页搜索、抓取、带引用的 RAG 问答与翻译。
v0.4.1
MCP server for AI agents to search major Chinese internet platforms with local-first login support.
v0.1.0
一个 API 取遍社交、名录与房产等公开网页数据,输出干净的 JSON。
v0.1.0
给 AI 代理一部电话:拨号、应对 IVR 语音菜单、持线等待并获得结构化答复。
v0.1.3
Self-hosted web search for LLM agents: search -> fetch -> rank pipeline with semantic caching
v0.1.0
Create sandboxed public-unlisted or access-key-protected HTML previews through a remote MCP server.
v0.3.0
美股、ETF、加密货币 → 精简简报:形态、支撑/阻力、市场状态 + 与基线对比的基础概率。非投资建议。
v0.1.0
将网页或 HTML 转换为整洁的、适配 LLM 的 Markdown 或 JSON。x402 按次付费,每次 0.005 美元,无需 API 密钥。
v1.0.0
校验 Sogou Spider 的 IP 地址,远程 MCP 提供 validate_ip 工具。
v1.0.0
校验 Baiduspider 的 IP 地址,远程 MCP 提供 validate_ip 工具。
v0.1.0
Publish HTML, Markdown, PDF, or images as instant shareable links with expiry and passwords.
v1.0.0
Publish AI-generated HTML to a live page on your own domain — from Claude, ChatGPT, or Cursor.
v1.4.2
检查 AI 爬虫的 robots.txt 策略,并监控公开站点的策略、sitemap 与 llms.txt 变化。
v1.4.1
检查 AI 爬虫的 robots.txt 策略,并监控公开站点的策略、sitemap 与 llms.txt 变化。
v1.1.0
以授权用户身份在 PasteHTML 上发布、更新并整理 HTML 与 Markdown 代码片段。
v1.0.0
Free technical-SEO audit MCP: crawl a site, run checks, return an LLM-ready shareable report.
v0.1.0
技术 SEO 与 GEO(AI 搜索)站点审计:托管抓取、按优先级排序的修复项与报告对比。
v0.1.0
Reddit MCP server: search posts, subreddit feeds, comments & user profiles as JSON. No API key.
v1.0.0
为 AI 智能体提供会付费的 fetch 客户端:支出上限、审批与回执,采用非托管方式。
v0.1.3
经由开放的 AT Protocol 批量抓取 Bluesky 资料及完整粉丝/关注列表导出,按记录付费。
v0.1.8
追踪 Bluesky 上的品牌提及与关键词:情感倾向、互动量与作者触达,按结果付费。
v0.2.2
基于 Common Crawl 开放网页图谱(44 亿条链接)提供外链查询与竞品差距分析。
v0.5.8
通用网页抓取器,输出适配 LLM 的 Markdown,支持 RAG 分块与 PDF/DOCX 解析。
v0.1.1
抓取 Shopify App Store 的应用、完整评论历史与全部目录,用于电商市场研究。
v0.1.4
抓取 Bluesky 的帖子、资料、粉丝、话题串与关键词搜索,输出整洁 JSON,按结果付费。
v1.3.0
俄罗斯 INN/OGRN、银行、地理与 WHOIS 查询,智能体通过 register_agent 自助注册,每日 20 次免费。
v0.1.2
只读的 X/Twitter MCP:帖子、推文串、回复与搜索,基于 twscrape,无需 API key。
v0.0.2
可验证抽取:从 PDF/URL 得到有来源支撑的 JSON;诚实空值 + 签名回执。
v1.0.0
Htmlpdf Transform Mcp 通过 MCP 把 AI 智能体接入真实的公开 API。
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。