HTML h1 count, markup discarded
v1.0.0
HTML h1 count, markup discarded
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 889 个资源 · 第 4 / 19 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.0
HTML h1 count, markup discarded
v1.0.0
HTML tag count, markup discarded
v1.0.0
HTML escape length, text discarded
v1.0.0
HEAD a public URL and return status only.
v1.0.0
HTTP status and content type for a public URL. Body discarded.
v0.1.0
Public Telegram channel posts, views, reactions, media and subscriber counts. No login needed.
v1.0.0
text/html marker
v2.0.0
Fetch and extract web pages, discover links, and read llms.txt documentation indexes.
v1.10.0
一个 API 覆盖 65 个平台、572 个端点:社交、电商、零售、招聘、金融与网页抓取。
v0.6.4
Web search, browser automation, scraping, crawling and CAPTCHA solving for AI agents.
v1.0.0
Extrai restaurantes do iFood no Brasil com endereço, categoria e CNPJ da Receita Federal.
v1.0.0
Scrapes Google News and returns the real publisher URLs, not redirect links.
v1.0.0
Reputação de empresas no Reclame Aqui: nota, índice de solução e total de reclamações.
v1.0.0
Extrai anúncios do ZAP Imóveis: venda e aluguel com preço, área, quartos e localização.
v1.2.0
Extract public webpages as Markdown, map sites, and run bounded crawl jobs. API key required.
v1.6.0
查询与统计抓取本站的 AI 爬虫索引情况,免费无需密钥(原文功能描述为未填写的占位符)。
v1.4.0
校验来访 IP 是真实的 Googlebot 等爬虫还是假冒者,免费无需密钥(原文功能描述为未填写的占位符)。
v0.1.2
Every ad an advertiser runs on Google, from the public Ads Transparency Center. Unofficial tool.
v0.2.0
Free URL preflight. Cited text via separate paid Stripe MPP API.
v2.9.2
Crawl documentation sites into local corpora agents can search, read, and diff fully offline.
v1.0.0
Any web page as clean Markdown for agents. Hosted, no install. Free tier; Pro adds JS rendering.
v1.2.0
抓取并遍历网站生成可查询的表格:商品、线索、Shopify 目录与房产数据。
v1.0.2
从 HTML/CSS、在线网站和可复用模板生成图片与 PDF。
v0.2.0
Web scraping & search for AI agents: extract, SearXNG search, rerank, robots compliance. No API key.
v0.5.0
Cloud scraping & crawling API for AI agents. Turn any URL into clean, LLM-ready markdown.
v0.1.1
以所选国家访客的身份抓取任意公开 URL,并给出带签名的来源回执。
v1.10.6
Paid fallback for public webpages: clean text, Markdown, links, metadata, and JavaScript rendering.
v0.4.1
无头模式运行 Screaming Frog SEO Spider:通过 CLI 执行抓取、导出并筛选数据,无需 GUI。
v0.2.1
Verify before your agent acts on data it paid for. Signed verdicts, checkable offline, via x402.
v0.1.1
AI speech-to-text for public TikTok videos: SRT, VTT, word timings, speaker labels, 90+ languages.
v0.1.20
Google Trends trending searches, volume estimates & trend duration. Not affiliated with Google LLC.
v1.0.2
三个 MCP 工具:fetch_page、fetch_pages_batch 与 search_web,为 AI 智能体输出无广告的 Markdown。
v1.0.1
发布并管理安全 HTML 链接:PII/密钥扫描、批量创建、补丁式编辑与访问分析。
v2.3.0
Turn HTML or mobile-learning exports into SCORM 2004/1.2 packages, and validate any SCORM zip.
v1.3.0
从公司公开网站检测其 CRM、序列化工具与营销自动化,输出适配 Clay。
v1.2.0
通过 Greenhouse、Lever、Ashby 从公司招聘页检测 GTM 招聘动态,输出适配 Clay。
v1.0.0
Ask before you fetch: will this domain serve your crawler, refuse it, or charge it?
v0.2.3
为你的代码库提供确定式上下文层:改动影响面、波及范围,答案附带依据。
v0.1.0
为 AI 代理把任意 URL 抓取成干净的 Markdown 或元数据,并可通过 x402 购买数字商品。
v1.0.0
把任意 URL 转为干净的 Markdown 与结构化数据:抓取、爬取、搜索与抽取。
v1.0.0
抓取搜索结果并获取所需的全部数据,来自 JoJ API 市场。
v1.0.0
ScrapeUnblocker 可绕过反爬服务并抓取完整页面源码。
v1.0.0
持续、快速地获取 Instagram 上的大量信息。
v1.0.8
MEOK AI Labs 出品的 HTML 解析 AI MCP 服务器。
v2.0.0
Premium agentic endpoint for behance-portfolio-scraper-mcp.
v1.0.1
Four free tools to check if AI engines can find, read and recognise a site. No API key.
v1.0.0
Pay-per-request webpage-to-Markdown extraction for AI agents. $0.005 USDC via x402 on Solana.
v0.3.0
Post-scrape data cleaner, no LLM: repairs mojibake, HTML, invisible chars. Plus a verdict.
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。