audio
共收录 99 个与 audio 相关的 MCP Server 与 Agent Skill,均附安装命令、来源与热度数据,可直接复制到 Cursor、Claude Code 等客户端。
Markdown 转换器
v1.0.0
io.clawhub.steipete/markdown-converter
使用 markitdown 将文档与文件转换为 Markdown。在转换 PDF、Word(.docx)、PowerPoint(.pptx)、Excel(.xlsx/.xls)、HTML、CSV、JSON、XML、图片(含 EXIF/OCR)、音频(含转写)、ZIP 归档、YouTube 链接或 EPub 为 Markdown 以供 LLM 处理或文本分析时使用。
OpenAI Whisper API
v1.0.0
io.clawhub.steipete/openai-whisper-api
通过 OpenAI 语音转写 API(Whisper)转写音频。
Edge TTS 语音合成
v2.0.0
io.clawhub.i3130002/edge-tts
使用 node-edge-tts npm 包进行文字转语音,把文本生成音频。支持多音色、多语言、语速调节、音高控制与字幕生成。适用于:(1) 用户以 tts 触发词请求音频/语音输出;(2) 内容需要听而非读(多任务、无障碍、开车、做饭场景);(3) 用户想指定音色、语速、音高或 TTS 输出格式。
cellcog 全能子智能体
v2.0.21
io.clawhub.cellcog/cellcog
任意输入到任意输出的 AI 子智能体——一次请求即可完成调研、图像、视频、音频、音乐、播客、数字人、语音克隆、文档、表格、仪表盘、3D 模型、图示与代码。采用智能体间协议并支持多步迭代以保证精度。DeepResearch Bench 第一名(2026 年 4 月)——深度推理覆盖所有模态,因此你的所有工作都能完成,而不只是代码。
FFmpeg 视频编辑
v1.0.0
io.clawhub.mahmoudadelbghany/ffmpeg-video-editor
把自然语言视频编辑需求转成 FFmpeg 命令——切割、裁剪、转换、压缩、改宽高比、提取音频等。
Cellcog 万能子代理
v2.0.15
io.clawhub.nitishgargiitd/cellcog
任意输入到任意输出的 AI 子代理——调研、图像、视频、音频、音乐、播客、数字人、声音克隆、文档、电子表格、仪表盘、3D 模型、图表等……(原文截断)
视频字幕稿下载器
v1.0.0
io.clawhub.steipete/video-transcript-downloader
从 YouTube 及任何 yt-dlp 支持的站点下载视频、音频、字幕与干净的段落式转写稿。当被要求“下载这个视频”“保存这个片段”“提取音频”“获取字幕”“获取转写稿”,或排查 yt-dlp/ffmpeg 与格式/播放列表问题时使用。
Songsee
v1.0.0
io.clawhub.steipete/songsee
通过 songsee CLI 从音频生成频谱图与特征面板可视化图像。
Wonda
v1.2.0
io.clawhub.degausai/wonda
使用 Wonda CLI 在终端生成图像、视频、音乐与音频——并支持 LinkedIn、Reddit 和 X/Twitter 的调研与自动化。
视频字幕 Video Subtitles
v1.0.0
io.clawhub.ngutman/video-subtitles
从视频/音频生成带翻译支持的 SRT 字幕。转录希伯来语(ivrit.ai)和英语(whisper),进行语言间翻译,并将字幕烧录进视频。用于生成字幕、转录文本或为 WhatsApp/社媒硬编码字幕。
yt-dlp 下载器 Yt Dlp Downloader
v0.1.0
io.clawhub.apollo1234/yt-dlp-downloader-skill
使用 yt-dlp 从 YouTube、Bilibili、Twitter 及上千个网站下载视频。当用户提供视频 URL 并想下载、提取音频(MP3)、下载字幕或选择视频质量时使用。在「下载视频」「download video」「yt-dlp」「YouTube」「B站」「抖音」「提取音频」「extract audio」等短语时触发。
Kokoro 语音合成
v0.1.0
io.clawhub.edkief/kokoro-tts
使用本地 Kokoro TTS 引擎将文本生成语音。当用户要求朗读某内容、请求语音消息或希望把文本转成语音时使用。
OpenAI 文本转语音
v1.0.0
io.clawhub.pors/openai-tts
通过 OpenAI Audio Speech API 实现文本转语音。
ElevenLabs 语音合成
v2.4.0
io.clawhub.shaharsha/elevenlabs-tts
ElevenLabs TTS——为 OpenClaw 打造的最佳 ElevenLabs 集成。支持情感音频标签的 ElevenLabs 文本转语音,为 WhatsApp……进行语音合成
音频生成
v1.0.17
io.clawhub.cellcog/audio-generation-cellcog
由 CellCog 驱动的 AI 音频生成与文本转语音。配音、旁白、语音克隆、数字人音色、音效、音乐、播客、对话。三家语音供应商(OpenAI、ElevenLabs、MiniMax)。从文本提示完成专业音频制作。
FFmpeg 音视频处理
v1.0.0
io.clawhub.ascendswang/ffmpeg-cli
使用 FFmpeg CLI 处理视频与音频:转码、切割、合并、音频提取、缩略图、GIF、变速、滤镜、字幕与水印。
FFmpeg 音视频处理
v1.0.0
io.clawhub.ivangdavila/ffmpeg
以正确的编解码器选择、滤镜与编码参数处理视频与音频。
语音转写
v1.0.1
io.clawhub.darinkishore/voice-transcribe
使用 OpenAI 的 gpt-4o-mini-transcribe 模型转写音频文件,支持词汇提示与文本替换。需要 uv(https://docs.astral.sh/uv/)。
ListenHub 内容创作
v0.6.0
io.clawhub.kkaticld/listenhub-ai
通过 ListenHub 把想法变成播客、讲解视频、语音旁白与 AI 图像。当用户想“做一期播客”“制作讲解视频……”时使用。
Seedance 视频生成
v1.0.3
io.clawhub.jackycser/seedance-video-generation
使用字节跳动 Seedance 生成 AI 视频。适用于:(1) 从文本提示生成视频,(2) 从图像生成视频(首帧、首尾帧、参考图),(3) 查询/管理视频生成任务。支持 Seedance 1.5 Pro(含音频)、1.0 Pro、1.0 Pro Fast 与 1.0 Lite 模型。
ElevenLabs 音频生成
v1.3.4
io.clawhub.odrobnik/elevenlabs
通过 ElevenLabs API 实现文本转语音、音效、音乐生成、声音管理与配额查询。当需要用 ElevenLabs 生成音频或管理……时使用。
AI 音频生成
v1.0.12
io.clawhub.nitishgargiitd/audio-cog
由 CellCog 驱动的 AI 音频生成与文本转语音。配音、旁白、声音克隆、虚拟人声、音效、音乐、播客、对话。
Audio 音频处理
v1.0.1
io.clawhub.ivangdavila/audio
处理、增强并转换音频文件:降噪、响度归一化、格式转换、转写与播客工作流。
Fal.ai API 生成
v0.1.0
io.clawhub.agmmnn/fal-ai
通过 fal.ai API 生成图像、视频与音频(FLUX、SDXL、Whisper 等)
TubeScribe 视频摘要
v1.1.8
io.clawhub.matusvojtek/tubescribe
YouTube 视频摘要器,支持说话人识别、排版文档与音频输出。开箱即用 macOS 内置 TTS。可选推荐工具(pandoc、ffmpeg、mlx-audio)可进一步提升质量。访问 YouTube 需要联网,无需付费 API 或订阅。当用户发送 YouTube 链接或要求总结/转写视频时使用。
Seedance 2.0 提示词工程技能
v2.0.0
io.clawhub.dandysuper/seedance-2-prompt-engineering-skill
生成精确、带时间码的 Seedance 2.0 提示词,将多模态输入与素材映射相结合,实现受控的 4–15 秒视频创作与编辑。
TTS 语音合成
v1.0.0
io.clawhub.amstko/tts
使用 Hume AI(或 OpenAI)API 将文本转为语音。当用户要求语音消息、语音回复或想“听”某段内容(法语 of vive voix)时使用。
ACE Music(免费 Suno 替代 AI 音乐生成)
v1.0.0
io.clawhub.fspecii/ace-music
通过 ACE Music 的免费 API 使用 ACE-Step 1.5 生成 AI 音乐。当用户要求创建、生成或作曲音乐、歌曲、节拍、纯音乐……时使用。无限免费生成完整带人声歌曲、任意流派、任意语言,无需订阅、额度或限制。
ElevenLabs 语音转文字
v1.0.0
io.clawhub.clawdbotborges/elevenlabs-stt
使用 ElevenLabs Speech-to-Text(Scribe v2)转写音频文件。
语音回复
v1.0.0
io.clawhub.stolot0mt0m/voice-reply
基于 sherpa-onnx 使用 Piper 音色的本地文本转语音。100% 离线,无需任何 API key。当用户要求语音回复、音频应答、朗读答案或希望听到朗读内容时使用。支持多语言,包括德语(thorsten)与英语(ryan)音色。输出兼容 Telegram 的语音消息(带 [[audio_as_voice]] 标签)。
Edge 语音合成
v1.0.1
io.clawhub.zhaov1976/voice
使用 Microsoft Edge 的 TTS 引擎将文本转语音,支持自定义音色、直接播放与临时文件自动清理。
Gemini 多媒体生成
v1.0.1
io.clawhub.xsir0/google-gemini-media
使用 Gemini API(Nano Banana 图像生成、Veo 视频、Gemini TTS 语音与音频理解)完成端到端的多模态媒体工作流,并提供“生成 + 理解”的代码模板。
语音消息
v1.0.4
io.clawhub.xmanrui/voice-message
使用 edge-tts 做文本转语音、ffmpeg 处理音频,在多个聊天渠道(Telegram、Discord、飞书/Lark、Signal。
notebooklm-cli
v0.1.0
io.clawhub.oconnell-carl/notebooklm-cli
通过命令行管理 Google NotebookLM 笔记本与知识源,并以编程方式生成音频、测验、报告。
本地语音转录
v1.0.2
io.clawhub.javicasper/transcribe
使用本地 Whisper(Docker)把音频文件转录为文本。适用于收到语音消息或音频文件(.mp3、.m4a、.ogg、.wav、.webm),或被要求转录音频内容时。
AI 音乐生成
v1.0.0
io.clawhub.ivangdavila/music-generation
用优化后的提示词生成 AI 音乐,支持风格控制与可直接使用的音频输出。
Flyworks 数字人视频
v1.0.0
io.clawhub.linhui99/flyworks-avatar-video
使用 Flyworks(即 HiFly)数字人生成视频:由图片制作口播视频、用公共数字人配合 TTS,或克隆声音生成自定义音频。
语音对话
v1.0.0
io.clawhub.rubenfb23/vocal-chat
处理 WhatsApp 上的语音到语音对话:自动转录收到的语音,并用本地 TTS 生成语音回复。当用户希望“说”而不是“打字”时使用。
OpenRouter 音频转录
v1.0.0
io.clawhub.obviyus/openrouter-transcribe
通过 OpenRouter 使用支持音频的模型(Gemini、GPT-4o-audio 等)转录音频文件。
语音转文字
v0.1.5
io.clawhub.okaris/speech-to-text
通过 inference.sh CLI 使用 Whisper 模型将音频转写为文本。模型:Fast Whisper Large V3、Whisper V3 Large。
AudioPod 音频处理
v1.2.3
io.clawhub.rakesh1002/audiopod
使用 AudioPod AI API 处理音频任务:AI 音乐生成(文生音乐、文生说唱、伴奏、采样、人声)、音轨分离、文生语音、降噪、语音转写、说话人分离与媒体提取。当用户需要从文本生成音乐/歌曲/说唱、拆分歌曲音轨/人声/乐器、从文本生成语音、清理嘈杂音频、转写音频/视频,或从 YouTube/URL 提取音频时使用。需要 AUDIOPOD_API_KEY 环境变量或直接传入 api_key。
Qwen3 本地语音合成
v1.0.0
io.clawhub.paki81/qwen-tts
基于 Qwen3-TTS-12Hz-1.7B-CustomVoice 的本地文本转语音。用于把文本生成音频、制作语音消息或被要求 TTS 时;支持含意大利语在内的 10 种语言、9 个高品质音色,以及基于指令的声音控制(情绪、语气、风格)。是 ElevenLabs 等云端 TTS 的替代方案,模型下载完成后可完全离线运行。
WhatsApp 语音合成
v1.0.0
io.clawhub.hopyky/tts-whatsapp
以 40 多种语言向 WhatsApp 发送高质量文本转语音消息,自动投递。
Gemini 语音识别
v1.1.0
io.clawhub.araa47/gemini-stt
使用 Google 的 Gemini API 或 Vertex AI 转录音频文件。
OpenClaw 虚拟形象视频消息
v0.1.2
io.clawhub.thewulf7/avatar-video-messages
用口型同步的 VRM 虚拟形象生成并发送视频消息。当用户要求视频消息、虚拟形象视频、视频回复,或希望以视频而非音频形式投递 TTS 时使用。
音频内容生成器
v1.0.0
io.clawhub.udiedrichsen/audio-gen
按需生成有声书、播客或教学音频。用户提供想法或主题,Claude AI 撰写脚本,ElevenLabs 转成高质量音频。支持多种格式(有声书、播客、教学)、自定义时长与声音效果。当用户要求制作音频内容、做播客、生成有声书或制作教学音频时使用。通过 MEDIA 标记返回 MP3 音频文件。
声音克隆 Vidu Audio Clone
v1.3.22
io.clawhub.dlazyai/dlazy-vidu-audio-clone
使用 Vidu 声音克隆技术,通过参考音频一键复制音色并生成新文本的朗读音频。
视频生成 Seedance 2.0
v1.3.21
io.clawhub.dlazyai/dlazy-seedance-2-0
字节跳动最新视频生成模型 Seedance 2.0,支持多模态参考(图片 + 视频 + 音频)生视频、首尾帧及文生视频,适合高质量多样化视频创作。