speech-to-text
共收录 21 个与 speech-to-text 相关的 MCP Server 与 Agent Skill,均附安装命令、来源与热度数据,可直接复制到 Cursor、Claude Code 等客户端。
OpenAI Whisper
v1.0.0
io.clawhub.steipete/openai-whisper
用 Whisper CLI 在本地做语音转文字(无需 API key)。
本地 Whisper 语音识别
v1.0.0
io.clawhub.araa47/local-whisper
本地运行的 OpenAI Whisper 语音转文字。模型下载后可完全离线。多种模型尺寸,高质量转写。
Faster Whisper 本地语音转文字
v1.5.1
io.clawhub.theplasmak/faster-whisper
基于 faster-whisper 的本地语音转文字。速度比 OpenAI Whisper 快 4-6 倍且精度相同;GPU 加速可实现约 20 倍实时转写。
macOS 本地语音
v1.0.0
io.clawhub.strrl/macos-local-voice
使用 Apple 原生能力在 macOS 上实现本地 STT 与 TTS:通过 yap(Apple Speech.framework)语音转文字,通过 say + ffmpeg 文字转语音。完全离线,无需 API key。包含语音质量检测与智能音色选择。
ElevenLabs 语音转文字
v1.0.0
io.clawhub.clawdbotborges/elevenlabs-stt
使用 ElevenLabs Speech-to-Text(Scribe v2)转写音频文件。
MLX 语音转文字
v1.0.7
io.clawhub.guoqiao/mlx-stt
使用 MLX(Apple Silicon)与开源模型(默认 GLM-ASR-Nano-2512)在本地进行语音转文字。
MLX Whisper 本地语音转文字
v1.0.0
io.clawhub.kevin37li/mlx-whisper
使用 MLX Whisper 进行本地语音转文字(Apple Silicon 优化,无需 API key)。
语音转文字
v0.1.5
io.clawhub.okaris/speech-to-text
通过 inference.sh CLI 使用 Whisper 模型将音频转写为文本。模型:Fast Whisper Large V3、Whisper V3 Large。
AudioPod 音频处理
v1.2.3
io.clawhub.rakesh1002/audiopod
使用 AudioPod AI API 处理音频任务:AI 音乐生成(文生音乐、文生说唱、伴奏、采样、人声)、音轨分离、文生语音、降噪、语音转写、说话人分离与媒体提取。当用户需要从文本生成音乐/歌曲/说唱、拆分歌曲音轨/人声/乐器、从文本生成语音、清理嘈杂音频、转写音频/视频,或从 YouTube/URL 提取音频时使用。需要 AUDIOPOD_API_KEY 环境变量或直接传入 api_key。
Gemini 语音识别
v1.1.0
io.clawhub.araa47/gemini-stt
使用 Google 的 Gemini API 或 Vertex AI 转录音频文件。
AssemblyAI 高级语音转写
v1.0.1
io.clawhub.tristanmanchester/assemblyai-transcribe
用 AssemblyAI 转写、分离说话人、翻译、后处理并结构化音频/视频。当用户明确要用 AssemblyAI、需要高... 时使用
本地 Whisper 语音转写
v1.5.0
io.clawhub.impkind/whisper-mlx-local
基于 Apple Silicon 上 MLX Whisper 的免费本地语音转写,服务 Telegram 与 WhatsApp。私密、无 API 费用。
语音转写(Speech is Cheap)
v1.2.0
io.clawhub.ilyakam/asr
快速且平价的自动语音转文本,支持 100 种语言、说话人分离、逐词时间戳,以及可定制的输出格式。
Venice AI 平台
v2.1.1
io.clawhub.jonisjongithub/venice-ai
完整的 Venice AI 平台——文本生成、视觉与图像分析、网页搜索、X/Twitter 搜索、嵌入、TTS、语音转文本、图像生成与背景处理(原文截断)。
ElevenLabs 转写
v1.0.1
io.clawhub.paulasjes/elevenlabs-transcribe
使用 ElevenLabs Scribe 将音频转写为文本。支持批量转写、从 URL 实时流式转写、麦克风输入与本地文件。
Addis 助手
v1.0.0
io.clawhub.dagmawibabi/addis-assistant-stt
使用 Addis Assistant API(api.addisassistant.com)提供语音转文字(STT)和文本翻译。适用于把音频(尤其是阿姆哈拉语)转为文字,或在语言之间翻译文本(如阿姆哈拉语转英语)。需要 'x-api-key'。
AI 语音消息收发
v1.0.0
io.clawhub.amreahmed/elevenlabs-voice
使用 ElevenLabs AI 实现文本转语音(TTS)与语音转文本(STT)。当用户想把文字转成语音、转写语音消息或处理多语言语音时使用。支持高质量 AI 音色与精准转写。
Parakeet 本地语音转文字
v1.1.0
io.clawhub.carlulsoe/parakeet-stt
基于 NVIDIA Parakeet TDT 0.6B v3(ONNX CPU 运行)的本地语音转文字。比 Whisper 快 30 倍,支持 25 种语言自动检测,兼容 OpenAI API。适用于本地转写音频、语音转文字或无需云端 API 处理录音。
Azure AI 语音转写(Python)
v0.1.0
io.clawhub.thegovind/azure-ai-transcription-py
Azure AI Transcription SDK 的 Python 版本。用于带时间戳与说话人分离的实时和批量语音转文字。触发语:transcription、speech to text、Azure AI Transcription、TranscriptionClient。
本地 Whisper(cpp)语音转文字
v1.0.0
io.clawhub.wuxxin/local-whisper-cpp
使用 whisper-cli(whisper.cpp)在本地进行语音转文字。
语音识别
v1.0.0
io.clawhub.gykdly/voice-recognition
基于 OpenAI Whisper CLI 的本地语音转文字。支持中文、英文等 100 多种语言,并可翻译与摘要。