PaperSprocket
v1.0.0
EU-hosted HTML-to-PDF rendering for agents and MCP clients. Temporary document processing.
使用场景/网页抓取与采集
从网页提取结构化内容、爬取文档、监控变更。适合调研、内容聚合、知识库构建。
共匹配 889 个资源 · 第 11 / 19 页
网页抓取类 MCP Server 把互联网内容变成 AI 可直接消费的结构化文本:Firecrawl 类服务负责整站爬取与 Markdown 转换,Fetch 类服务负责单页拉取与重定向处理。相比浏览器自动化,它们不渲染交互、速度快、token 消耗低,是构建 RAG 语料与知识库的首选采集层。
典型工作流:用 Firecrawl MCP 批量爬取文档站 → 清洗为 Markdown → 送入向量库(如 Qdrant / Chroma MCP)→ 再用检索 MCP 让 AI 基于自有语料回答。AgentHub 上每个抓取类资源都附带安装命令与客户端配置,可直接复制到 Cursor 或 Claude Code。
合规边界:只抓取公开页面,遵守目标站点 robots.txt 与服务条款;控制并发与频率,避免给对方服务造成压力;需要登录才能访问的内容不要自动化批量拉取。
v1.0.0
EU-hosted HTML-to-PDF rendering for agents and MCP clients. Temporary document processing.
v0.5.26
Stealth web browser for agents: search, fetch, click, download and type in persistent MCP sessions.
v1.0.0
Document to Markdown MCP server: PDF, Word, PowerPoint, Excel and HTML, with OCR for large files.
v1.0.1
PDF/Word/Excel/HTML to clean Markdown for LLMs and RAG. Keys $19/mo; 50 free calls a day.
v0.1.0
Deterministic knowledge for AI agents: search, fetch, cite and verify a 48M-entry knowledge base.
v1.0.0
Search and fetch hand-drawn icons, illustrations and isometric drawings. The free set needs no key.
v1.0.0
The bitHuman docs over MCP: two read-only tools, search and fetch; it needs no account and no key.
v1.0.0
Cut audio from YouTube, TikTok or Instagram links to MP3/WAV, and fetch video transcripts.
v0.1.1
Agent-native internet gateway: typed search, fetch, scrape, crawl, and extract via the Clawifi API.
v0.10.0
Technical SEO in Claude: GSC + crawl + DataForSEO - audit, market sizing, content recon.
v1.0.0
Search the live web and fetch clean content from source pages.
v1.1.2
Audit a business website for observed crawl and indexing issues with source-linked fixes.
v0.1.4
Transcribe audio/video files or URLs via the WhipScribe cloud API and fetch the transcript.
v0.1.5
Save how to read a public web page once, then fetch fresh items as JSON without a browser.
v0.3.0
Self-hosted, Tavily-compatible web search, extract, crawl and map tools for AI agents.
v1.0.1
HTML 转 PDF 的 MCP 服务器——把 HTML 渲染成像素级还原的 PDF。
v0.1.1
为 AI 代理提供结构化的网页研究能力:搜索。
v0.1.1
Google 地图爬虫,提取商家联系信息:邮箱、电话。
v0.4.15
在智能体读取文档前检查其中的隐藏文本,支持 PDF、Office、RTF、HTML。
v1.1.0
Search PubMed biomedical literature and fetch article summaries. No key required.
v1.0.0
Search and fetch SVG icons from 250,000+ icons across 200+ open-source icon sets.
v0.1.1
Search DataCite datasets and software, fetch DOI metadata, trace relations, format citations.
v0.1.2
Zyte API MCP — unified web fetch + AI extraction (zyte.com)
v0.1.2
NCBI E-utilities——Entrez 联合检索与抓取(PubMed/Gene/Nucleotide 等)。
v1.0.1
Real files for AI assistants: HTML to image/PDF, screenshots, QR, charts, PDF tools, validators.
v0.4.0
Compose BrandBrain asset flows, run mock/live generation, and fetch outputs
v1.0.0
Share HTML and Markdown files from AI agents within your company, with versions and comments.
v0.2.1
Figma to pixel-perfect code: deterministic HTML/React, then a render + pixel-diff verify loop.
v0.3.1
Free HTML parsing; static web context at 0.01 USDC via x402. Paid reads need a wallet adapter.
v0.1.2
Apify MCP — run web-scraping Actors and fetch their dataset results.
v1.0.0
Hosted MCP for iReceipt.pro: author, validate and preview HTML templates rendered to PDF and images.
v0.1.0
Web search and clean-text page fetch for AI agents, with SSRF protection.
v0.2.1
Self-hosted, Tavily-compatible web search, extract, crawl and map tools for AI agents.
v1.0.0
AI claim verification MCP endpoint with x402 payments and stealth web fetch
v1.145.0
对 .md、.rst、.adoc、.ipynb、.html、.yaml、.json 以及 OpenAPI 规范做章节级文档检索。
v1.0.0
Web scraping for agents: scrape, crawl, map, search and extract pages as clean markdown or JSON.
v0.3.0
检索图书与作者、获取版本信息、浏览主题并解析封面图片。
v0.8.9
Your AI writes HTML; Envie renders it to video on your machine, verifies it and shows it back.
v0.3.0
检索 Wayback Machine 与互联网档案馆图书馆(4000 万条以上条目),获取快照、条目元数据与正文。
v0.1.8
HTML/URL to PDF, screenshots, e-invoices. PDF/A and PDF/UA output with optional veraPDF verify.
v1.3.42
Audit public webpages and supplied markup for HTML, CSS, SEO, JSON-LD, and link issues.
v1.1.2
Publish text or HTML to Snapy.host and get a shareable link that shows who opened it.
v0.5.3
MCP server that pays x402-gated HTTP endpoints — fetch, and on a 402 authorize, sign, retry
v0.1.1
Search Japanese laws via e-Gov Law Search and fetch article text with source attribution.
v0.4.1
解析 DOI,通过 Crossref REST API 检索约 1.55 亿条学术作品并获取参考文献。
v0.3.3
Lookout — web answers with source-level proof. Search and fetch citeable excerpts, no API key.
v1.0.0
Check whether a website is readable by AI agents: robots, llms.txt, sitemap, HTML. Bounded.
v4.0.3
Search and fetch AI agents, skills, prompts and MCP connectors from the Spark marketplace.
静态或服务端渲染的页面、整站文档爬取用抓取类(Firecrawl/Fetch);需要点击、滚动、登录交互或抓渲染后截图,用浏览器自动化(Playwright MCP)。
托管版需要;也可以自部署开源版,或用免费的 Fetch MCP 做单页抓取。资源详情页会标注分发方式与所需环境变量。
常见做法是 Markdown 清洗后写入向量库 MCP(Qdrant、Chroma、pgvector 等),再配合检索 Skill 或 Context7 类知识库 MCP 完成问答。