replicate-mcp-server 模型调用
v3.2.3
io.github.sena-labs/replicate-mcp-server
Replicate 的 MCP 服务器,共 36 个工具:图像、视频、音频、语音、大模型、视觉、超分、3D 与训练。
“Vision” 共 121 个结果
v3.2.3
io.github.sena-labs/replicate-mcp-server
Replicate 的 MCP 服务器,共 36 个工具:图像、视频、音频、语音、大模型、视觉、超分、3D 与训练。
v0.4.0
io.github.hoainho/podium-mcp
移动端 E2E MCP(51 个工具):覆盖 iOS 与 Android、原生 UI 与 canvas/WebGL,无需视觉模型,支持 RN 调试。
v0.29.10
io.github.tosin2013/helmdeck
自托管 MCP 服务,为任意智能体提供沙箱浏览器、桌面、视觉与代码编辑工具包。
v0.2.1
io.github.afferens/mcp-server
面向 AI 智能体的实时物理感知——视觉、空间、声学与环境影响。
v0.1.5
io.github.perceptdot/sentry
面向 AI 智能体的 Sentry 错误追踪视角——附带 ROI 度量,详见 perceptdot.com
v0.1.5
io.github.perceptdot/github
面向 AI 智能体的 GitHub 仓库监控视角——附带 ROI 度量。
v0.1.6
io.github.perceptdot/vercel
面向 AI 智能体的 Vercel 部署视角——附带 ROI 度量,详见 perceptdot.com
v0.2.6
io.github.perceptdot/ga4
面向 AI 智能体的 Google Analytics 4 视角——附带 ROI 度量,详见 perceptdot.com
v1.10.0
io.github.felixgeelhaar/scout
具备 84 个工具的浏览器自动化 MCP server:纯 CDP 实现,支持 DOM 差分与视觉混合模式。
v0.1.0
ai.roc/mcp
ROC 生物识别与计算机视觉能力:人脸、车牌、OCR、行人、车辆与枪支检测。
v0.1.0
app.contendeo/contendeo
多模态视频分析 MCP —— 对任意视频 URL 进行转写、视觉理解与 OCR。
v1.0.3
com.roboflow/roboflow-mcp
面向 AI 智能体的 Roboflow 计算机视觉:数据集、标注、版本、工作流与推理。
v1.0.0
io.github.mlintangmz2765/scholar
面向深度学术研究的加固版 Scholar MCP,接入 Scopus、OpenAlex、Unpaywall 并支持 PDF 视觉解析。
v0.2.0
io.github.ykshah1309/stealth-agent-browser-mcp
隐身 Chromium MCP 服务器,融合 AOM 与 Set-of-Mark 视觉方案,并用 Readability 提取正文。
v1.0.1
io.github.divitkashyap/auto-skill-loader
自动将技能加载到智能体会话中,并提供 MiniMax 视觉与搜索代理。
v0.9.27
io.github.ndjordjevic/pinrag
MCP 版 RAG:索引 PDF、代码仓库、YouTube、Discord 与文本,可选 YouTube 视觉解析,检索结果附引用。
v0.2.9
io.github.saranshbamania/mobile-device-mcp
AI 控制 Android/iOS 设备:截图、UI 树、AI 视觉、Flutter、视频,共 49 个工具。
v0.1.2
io.github.AdonaiVera/fiftyone-mcp-server
通过 AI 助手以 80 多个算子控制 FiftyOne 计算机视觉数据集。
v1.0.2
io.github.PyJudge/pdf4vllm
面向视觉 LLM 的 PDF 阅读器,可自动检测文本损坏并切换为图像模式。
v1.0.0
io.github.shalevshalit/image-recognition-mcp
基于 OpenAI 视觉模型的 AI 图像识别与描述 MCP 服务器。
v1.0.0
io.github.shalevshalit/image-recongnition-mcp
基于 OpenAI 视觉模型的 AI 图像识别与描述 MCP 服务器。
io.github.K-Dense-AI/scientific-agent-skills/paperclip
使用 GXL 的 Paperclip CLI 检索和阅读生物医学论文全文、FDA/PMDA/EMA 监管文件、临床试验注册信息和 UniProt/PDB/ChEMBL 条目。涵盖用 PAPERCLIP_API_KEY 安装与鉴权 `paperclip` 二进制、/papers、/fda、/trials、/proteins、/clipboard 下的只读虚拟文件系统、来源范围的语义搜索、全语料 grep、元数据查询与 SQL、跨多篇论文的 map/reduce 阅读、图像视觉分析、带论断核验的可选论文仓库,以及锁定行号的引用。当被要求安装 paperclip、运行 paperclip search/grep/map/reduce/sql/repo、通过 paperclip 查找或阅读生物医学文献、监管文件或临床试验,或生成带行号的引用时使用。
io.github.davila7/claude-code-templates/computer-use-agents
构建像人一样操作计算机的 AI 智能体——看屏幕、移动光标、点击按钮、输入文字。覆盖 Anthropic Computer Use、OpenAI Operator/CUA 及开源替代方案,重点关注沙箱化、安全以及基于视觉控制带来的独特挑战。触发场景:computer use、桌面自动化智能体、屏幕控制 AI、视觉智能体、GUI 自动化。
io.github.sickn33/antigravity-awesome-skills/hugging-face-model-trainer
使用 TRL(Transformer Reinforcement Learning)或 Unsloth,配合 Hugging Face Jobs 基础设施训练或微调语言模型与视觉模型。涵盖 SFT、DPO、GRPO 与奖励建模训练方法,以及用于本地部署的 GGUF 转换。