图片处理 Vision
v3.5.0
io.clawhub.xueyetianya/vision
使用 ImageMagick 对图片进行缩放、裁剪、转换与优化。适用于处理照片、格式转换(PNG/WebP)、压缩体积或添加水印。
“Vision” 共 22 个结果
v3.5.0
io.clawhub.xueyetianya/vision
使用 ImageMagick 对图片进行缩放、裁剪、转换与优化。适用于处理照片、格式转换(PNG/WebP)、压缩体积或添加水印。
io.github.MiniMax-AI/skills/vision-analysis
借助 MiniMax 视觉 MCP 工具分析、描述并提取图像信息。适用场景:用户分享图片文件路径或 URL(消息中含 .jpg、.jpeg、.png、.gif、.webp、.bmp、.svg 扩展名),或在提及图像时使用 analyze、analyse、describe、explain、understand、look at、review、extract text、OCR 等词,对象可以是 image、screenshot、diagram、chart、mockup、wireframe、photo。另外触发:UI 原型评审、线框图分析、设计点评、图表数据提取、物体识别、人/动物/活动识别。
v1.1.0
io.clawhub.johanesalxd/vision-sandbox
通过 Gemini 原生代码执行沙盒实现智能体视觉。用于空间定位、视觉数学与 UI 审查。
v1.0.0
io.clawhub.cntuang/image-vision
解析并理解图像:描述内容、提取文字、回答问题、对比视觉素材,并从 JPG、PNG、GI……中抽取结构化数据
v1.0.0
io.clawhub.zorrong/computer-vision-expert
SOTA 计算机视觉专家(2026)。专精 YOLO26、Segment Anything 3(SAM 3)、视觉语言模型与实时空间分析。
v2.1.1
io.clawhub.alirezarezvani/senior-computer-vision
面向目标检测、图像分割与视觉 AI 系统的计算机视觉工程技能。涵盖 CNN 与 Vision Transformer 架构、YOLO/Fast... 等模型。
io.github.NousResearch/hermes-agent/hermes-s6-container-supervision
修改或调试 Hermes Docker 镜像中的 s6 服务。
v2.1.1
io.clawhub.visiongeist/coolify
通过 Coolify API 管理 Coolify 部署、应用、数据库与服务。当用户想在 Coolify 上部署、启动、停止、重启或管理应用时使用。
v0.3.1
io.clawhub.visionik/mogcli
Microsoft Ops Gadget——面向 Microsoft 365 的 CLI(邮件、日历、云盘、联系人、任务、Word、PowerPoint、Excel、OneNote)。
io.github.iflytek/iFly-Skills/iflytek-image-understanding
用于用户要求分析图片、描述图像内容或回答与图片相关问题的场景。讯飞图片理解——基于星火视觉(Spark Vision)模型分析图片并回答问题,采用 WebSocket API,仅使用 Python 标准库,无需 pip 依赖。
v1.0.4
io.clawhub.quanru/midscene-computer-automation
使用 Midscene 实现基于视觉的桌面自动化,用自然语言控制你的桌面(macOS、Windows、Linux)。
v1.0.2
io.clawhub.quanru/midscene-android-automation
基于 Midscene 的视觉驱动 Android 设备自动化。完全从截图操作——无需 DOM 或无障碍标签。
v1.0.2
io.clawhub.blueberrywoodsym/x-ai
通过 xAI API 与 Grok 模型对话。支持 Grok-3、Grok-3-mini、视觉模型等。
v1.1.1
io.clawhub.poiley/findmy-location
通过 Apple“查找”以街道级精度追踪已共享位置的联系人。读取地图地标后返回地址、城市与场景(家/公司等)。支持配置已知地点,未知地点可用视觉兜底识别。
v2.1.1
io.clawhub.jonisjongithub/venice-ai
完整的 Venice AI 平台——文本生成、视觉与图像分析、网页搜索、X/Twitter 搜索、嵌入、TTS、语音转文本、图像生成与背景处理(原文截断)。
v1.3.1
io.clawhub.mvanhorn/xai
通过 xAI API 与 Grok 模型对话。支持 Grok-4、Grok-4.20、Grok-3、Grok-3-mini、视觉能力以及 X 实时搜索。
v0.1.3
io.clawhub.borahm/recipe-to-list
把菜谱变成 Todoist 购物清单:从菜谱照片(Gemini Flash 视觉)或菜谱网页(搜索+抓取)提取食材,与现有 Shopping 项目按保守的同义词/重叠规则比对,跳过盐/胡椒等常备品,单位一致时合并数量;并把每次烹制的菜谱存入工作区食谱库(recipes/)。
vv2.0.2
io.clawhub.mischasigtermans/xai-plus
搜索 X/Twitter 与网页、与 Grok 模型对话(文本+视觉),并使用 xAI API 分析 X 内容。 适用场景:搜索 X 帖子/话题串、经 Grok 做网页调研、与 Grok 聊天、分析语音模式、 研究趋势或检查帖子质量。触发词:grok、xai、search x、search twitter、x search、 ask grok、grok chat、analyze voice、x trends。
io.github.K-Dense-AI/scientific-agent-skills/paperclip
使用 GXL 的 Paperclip CLI 检索和阅读生物医学论文全文、FDA/PMDA/EMA 监管文件、临床试验注册信息和 UniProt/PDB/ChEMBL 条目。涵盖用 PAPERCLIP_API_KEY 安装与鉴权 `paperclip` 二进制、/papers、/fda、/trials、/proteins、/clipboard 下的只读虚拟文件系统、来源范围的语义搜索、全语料 grep、元数据查询与 SQL、跨多篇论文的 map/reduce 阅读、图像视觉分析、带论断核验的可选论文仓库,以及锁定行号的引用。当被要求安装 paperclip、运行 paperclip search/grep/map/reduce/sql/repo、通过 paperclip 查找或阅读生物医学文献、监管文件或临床试验,或生成带行号的引用时使用。
io.github.davila7/claude-code-templates/computer-use-agents
构建像人一样操作计算机的 AI 智能体——看屏幕、移动光标、点击按钮、输入文字。覆盖 Anthropic Computer Use、OpenAI Operator/CUA 及开源替代方案,重点关注沙箱化、安全以及基于视觉控制带来的独特挑战。触发场景:computer use、桌面自动化智能体、屏幕控制 AI、视觉智能体、GUI 自动化。
io.github.sickn33/antigravity-awesome-skills/hugging-face-model-trainer
使用 TRL(Transformer Reinforcement Learning)或 Unsloth,配合 Hugging Face Jobs 基础设施训练或微调语言模型与视觉模型。涵盖 SFT、DPO、GRPO 与奖励建模训练方法,以及用于本地部署的 GGUF 转换。
io.github.tech-leads-club/agent-skills/frontend-blueprint
AI 前端专家与设计顾问:在生成任何代码前引导用户完成结构化需求探索,收集视觉参考、设计 token、字体排印、图标、布局偏好与品牌规范,让最终产出高保真贴合用户构想。当用户要求构建、设计、创建或改进任何前端界面——网站、落地页、仪表盘、组件、应用、邮件、表单、弹窗或任意 UI 元素——时使用。也响应「给我做一个 UI」「设计一个页面」「做一个组件」「改进这个布局」「让它更好看」「frontend」「interface」「redesign」,或当用户提供 mockup、截图、设计参考时触发。不用于后端逻辑、API 设计、数据库模式或非视觉代码任务。