transcription
共收录 20 个与 transcription 相关的 MCP Server 与 Agent Skill,均附安装命令、来源与热度数据,可直接复制到 Cursor、Claude Code 等客户端。
Markdown 转换器
v1.0.0
io.clawhub.steipete/markdown-converter
使用 markitdown 将文档与文件转换为 Markdown。在转换 PDF、Word(.docx)、PowerPoint(.pptx)、Excel(.xlsx/.xls)、HTML、CSV、JSON、XML、图片(含 EXIF/OCR)、音频(含转写)、ZIP 归档、YouTube 链接或 EPub 为 Markdown 以供 LLM 处理或文本分析时使用。
本地 Whisper 语音识别
v1.0.0
io.clawhub.araa47/local-whisper
本地运行的 OpenAI Whisper 语音转文字。模型下载后可完全离线。多种模型尺寸,高质量转写。
YouTube 视频检索
v1.0.1
io.clawhub.grpaiva/youtube
通过 YouTube Data API v3 的 MCP server 搜索视频、获取频道信息、视频详情与字幕文稿,或使用 yt-dlp 作为后备方案。
YouTube 摘要器 YouTube Summarizer
v1.0.0
io.clawhub.abe238/youtube-summarizer
自动抓取 YouTube 视频字幕稿、生成结构化摘要并将完整字幕稿发送到消息平台。检测 YouTube URL 并提供元数据、关键洞察和可下载字幕稿。
Faster Whisper 本地语音转文字
v1.5.1
io.clawhub.theplasmak/faster-whisper
基于 faster-whisper 的本地语音转文字。速度比 OpenAI Whisper 快 4-6 倍且精度相同;GPU 加速可实现约 20 倍实时转写。
Audio 音频处理
v1.0.1
io.clawhub.ivangdavila/audio
处理、增强并转换音频文件:降噪、响度归一化、格式转换、转写与播客工作流。
Telegram 语音 Whisper 转录
v1.0.0
io.clawhub.drones277/tg-voice-whisper
Telegram 语音消息 Whisper 自动转录技能。
OpenRouter 音频转录
v1.0.0
io.clawhub.obviyus/openrouter-transcribe
通过 OpenRouter 使用支持音频的模型(Gemini、GPT-4o-audio 等)转录音频文件。
语音转文字
v0.1.5
io.clawhub.okaris/speech-to-text
通过 inference.sh CLI 使用 Whisper 模型将音频转写为文本。模型:Fast Whisper Large V3、Whisper V3 Large。
AudioPod 音频处理
v1.2.3
io.clawhub.rakesh1002/audiopod
使用 AudioPod AI API 处理音频任务:AI 音乐生成(文生音乐、文生说唱、伴奏、采样、人声)、音轨分离、文生语音、降噪、语音转写、说话人分离与媒体提取。当用户需要从文本生成音乐/歌曲/说唱、拆分歌曲音轨/人声/乐器、从文本生成语音、清理嘈杂音频、转写音频/视频,或从 YouTube/URL 提取音频时使用。需要 AUDIOPOD_API_KEY 环境变量或直接传入 api_key。
AssemblyAI 高级语音转写
v1.0.1
io.clawhub.tristanmanchester/assemblyai-transcribe
用 AssemblyAI 转写、分离说话人、翻译、后处理并结构化音频/视频。当用户明确要用 AssemblyAI、需要高... 时使用
语音转写(Speech is Cheap)
v1.2.0
io.clawhub.ilyakam/asr
快速且平价的自动语音转文本,支持 100 种语言、说话人分离、逐词时间戳,以及可定制的输出格式。
音频本地转写
v1.0.0
io.clawhub.aktheknight/audio-transcribe
使用 faster-whisper 在本地自动转写语音消息,可选多种 Whisper 模型,无需 API 密钥。
ElevenLabs 转写
v1.0.1
io.clawhub.paulasjes/elevenlabs-transcribe
使用 ElevenLabs Scribe 将音频转写为文本。支持批量转写、从 URL 实时流式转写、麦克风输入与本地文件。
MarkItDown 文档转换
v1.0.1
io.clawhub.karmanverma/markitdown-skill
将文档转换为 Markdown 的 OpenClaw 技能。提供 Microsoft MarkItDown 库的文档与工具。支持 PDF、Word、PowerPoint、Excel、图像(OCR)、音频(转写)、HTML、YouTube。
阿里云语音识别
v1.0.10
io.clawhub.jixsonwang/aliyun-asr
纯阿里云 ASR 技能,用于语音消息转写,支持包括飞书在内的多渠道。
AI 语音消息收发
v1.0.0
io.clawhub.amreahmed/elevenlabs-voice
使用 ElevenLabs AI 实现文本转语音(TTS)与语音转文本(STT)。当用户想把文字转成语音、转写语音消息或处理多语言语音时使用。支持高质量 AI 音色与精准转写。
Azure AI Voice Live(Python)
v0.1.0
io.clawhub.thegovind/azure-ai-voicelive-py
使用 Azure AI Voice Live SDK(azure-ai-voicelive)构建实时语音 AI 应用。当需要创建与 Azure AI 进行实时双向音频通信的 Python 应用时使用,包括语音助手、语音聊天机器人、实时语音到语音翻译、语音驱动的虚拟形象,或任何基于 WebSocket 的 AI 模型音频流式传输。支持服务端 VAD(语音活动检测)、回合式对话、函数调用、MCP 工具、虚拟形象集成与转录。
Azure AI 语音转写(Python)
v0.1.0
io.clawhub.thegovind/azure-ai-transcription-py
Azure AI Transcription SDK 的 Python 版本。用于带时间戳与说话人分离的实时和批量语音转文字。触发语:transcription、speech to text、Azure AI Transcription、TranscriptionClient。
视频摘要
v1.6.3
io.clawhub.lifei68801/video-summary
针对 B站、小红书、抖音和 YouTube 的视频总结:通过转写与摘要从视频内容中提炼要点。