视频制作
v2.2.1
io.clawhub.a1024708231/video-producer
短视频一键生成技能 v2.2。调用video-director进行画面规划,然后生成AI素材、TTS配音、视频渲染,输出完整MP4。
“Text-to-Speech” 共 32 个结果
v2.2.1
io.clawhub.a1024708231/video-producer
短视频一键生成技能 v2.2。调用video-director进行画面规划,然后生成AI素材、TTS配音、视频渲染,输出完整MP4。
v1.3.22
io.clawhub.dlazyai/dlazy-gemini-2-5-tts
使用 Gemini 2.5 强大的文本转语音能力,生成多语言、高自然度的音频。
v1.2.6
io.clawhub.byungkyu/elevenlabs-api
ElevenLabs API 集成,托管鉴权。AI 驱动的文字转语音、声音克隆、音效与音频处理。当用户要从文字生成语音、克隆声音、制作音效或处理音频时使用本技能。其他第三方应用请使用 api-gateway 技能(https://clawhub.ai/byungkyu/api-gateway)。调用经由带 OAuth 登录的 maton CLI 执行;无法安装 CLI 时通过原始 HTTP 加 Maton API key 调用。每次调用都以用户连接身份鉴权,只能访问该连接授权范围内的数据(由服务商在每次请求时强制执行);本文档所列端点即本技能使用的端点,其他端点需用户点名要求方可使用。默认进行读取和列表操作,每次写操作或新建连接均需与用户确认。
v1.1.5
io.clawhub.gizmogremlin/voice-ai-voices
使用 Voice.ai API 进行高质量语音合成,提供 9 种人格音色、11 种语言与流式输出。
v0.1.0
io.clawhub.thegovind/podcast-generation
通过 WebSocket 使用 Azure OpenAI 的 GPT Realtime Mini 模型生成 AI 播客式音频叙事。适用于构建语音合成、音频叙事生成、内容转播客,或集成 Azure OpenAI Realtime API 输出真实音频。涵盖从 React 前端到 Python FastAPI 后端及 WebSocket 流式传输的全栈实现。
v1.0.0
io.clawhub.amreahmed/elevenlabs-voice
使用 ElevenLabs AI 实现文本转语音(TTS)与语音转文本(STT)。当用户想把文字转成语音、转写语音消息或处理多语言语音时使用。支持高质量 AI 音色与精准转写。
v1.0.0
io.clawhub.gugic/inworld-tts
通过 Inworld.ai API 进行文本转语音。当需要从文本生成语音音频、生成口语回复,或将文本转换为 MP3/音频文件时使用。支持多种音色、语速,以及长文本流式输出。
v1.0.1
io.clawhub.sherajdev/pocket-tts
使用 Kyutai 的 Pocket TTS 模型,在 CPU 上离线生成高质量英文语音,内置 8 种音色或支持自定义声音克隆。