iFlytek 声音复刻 TTS
io.github.iflytek/iFly-Skills/iflytek-voiceclone-tts
用于用户要求复刻声音、训练自定义音色或用克隆声音合成语音的场景。讯飞声音复刻 TTS——从音频样本训练自定义音色模型,并用克隆出的声音合成语音,覆盖完整流程:获取训练文本、创建任务、上传音频、提交训练、轮询结果、用克隆声音合成。仅依赖 Python 标准库,无需 pip 依赖。
“GitHub” 共 31,925 个结果
io.github.iflytek/iFly-Skills/iflytek-voiceclone-tts
用于用户要求复刻声音、训练自定义音色或用克隆声音合成语音的场景。讯飞声音复刻 TTS——从音频样本训练自定义音色模型,并用克隆出的声音合成语音,覆盖完整流程:获取训练文本、创建任务、上传音频、提交训练、轮询结果、用克隆声音合成。仅依赖 Python 标准库,无需 pip 依赖。
io.github.iflytek/iFly-Skills/iflytek-video-translate
用于用户要求翻译视频、为视频配音或把视频本地化为其他语言的场景。基于讯飞视频翻译 API 的 AI 配音式翻译,支持视频语言转换、语音配音与多语言视频本地化,提供任务创建、任务列表与任务详情查询,适合内容创作者与本地化团队。
io.github.iflytek/iFly-Skills/iflytek-translate
讯飞机器翻译——在中文、英文、日文、韩文、法文、西班牙文、德文、俄文、阿拉伯文、泰文、越南文等数十种语言之间互译。当用户需要翻译文本时使用。仅依赖 Python 标准库,无需 pip 依赖。
io.github.iflytek/iFly-Skills/iflytek-text-proofread
讯飞公文校对——检测并修正中文文本中的错别字、标点、语序、事实性错误与敏感内容等 27 类错误,单次最多支持 22 万字符。当用户需要校对、检查或修正中文文本,尤其是公文时使用。仅依赖 Python 标准库,无需 pip 依赖。
io.github.iflytek/iFly-Skills/iflytek-speed-transcription
基于讯飞极速转写 API 的高速语音转写:每小时音频约 20 秒完成,最长支持 5 小时的音频文件(WAV/PCM/MP3)。支持中文、英文以及 202 种以上中文方言,并可自动识别语种。当用户要求转写音频、语音转文字,或提到“极速转写”(speed transcription)时使用。
io.github.iflytek/iFly-Skills/iflytek-pdf-image-ocr
讯飞 PDF 与图片 OCR 技能,同时支持图片 OCR(AI 大模型 OCR)与 PDF 文档识别。用于对图片或 PDF 做 OCR、从图像/PDF 中提取文本、把 PDF 转换为 Word/Markdown,或对图片与 PDF 执行其他 OCR 任务;支持多语言文本提取、版面理解与多种输出格式。
io.github.iflytek/iFly-Skills/iflytek-ocr-invoice
用于用户要求识别发票、提取票据数据或对账单票据做 OCR 的场景。基于讯飞 OCR(科大讯飞票据识别)从发票、收据与票据中识别并提取结构化数据,支持增值税发票、出租车小票、火车票、通行费发票、医疗票据等多种类型。
io.github.iflytek/iFly-Skills/iflytek-image-understanding
用于用户要求分析图片、描述图像内容或回答与图片相关问题的场景。讯飞图片理解——基于星火视觉(Spark Vision)模型分析图片并回答问题,采用 WebSocket API,仅使用 Python 标准库,无需 pip 依赖。
io.github.iflytek/iFly-Skills/iflytek-hyper-tts
用于用户要求合成语音、文字转音频或朗读文本的场景。讯飞超拟人语音合成——支持文本转语音与语音合成(发音人/语速/语调/音量/输出格式),属大模型语音合成技能。关键词:语音合成、文字转语音、超拟人、TTS。
io.github.iflytek/iFly-Skills/iflytek-contract-intelligence-review
用于用户要求审查合同、识别合同风险或执行合规检查的场景。合同智能审核——对合同扫描件、图片合同、双语合同进行完整审核,覆盖 OCR 识别、条款分析、风险检测、合规校对、翻译摘要全流程。适用于法务审核、采购合同审查、供应链合规检查等场景。关键词:合同审核、风险检测、条款分析、合规校对。
io.github.iflytek/iFly-Skills/animated-sketch-diagram
生成"黑墨手绘涂鸦"风格的动画架构图/流程图:米色纸面、针管笔墨线、极淡水洗色块、简笔涂鸦图标、序号章、连线上的流动圆点动画、图标微动效。产出单文件自包含动画 HTML(SVG+CSS),可一键导出无缝循环 GIF。当用户想画架构图、流程图、信息图、技术示意图、对比图、pipeline/workflow 可视化,或提到"手绘风""涂鸦风""动图""animated diagram""GIF 架构图"时使用;即使用户没明说要动画,做技术概念科普配图时也应优先考虑本 skill。
io.github.MiniMax-AI/skills/vision-analysis
借助 MiniMax 视觉 MCP 工具分析、描述并提取图像信息。适用场景:用户分享图片文件路径或 URL(消息中含 .jpg、.jpeg、.png、.gif、.webp、.bmp、.svg 扩展名),或在提及图像时使用 analyze、analyse、describe、explain、understand、look at、review、extract text、OCR 等词,对象可以是 image、screenshot、diagram、chart、mockup、wireframe、photo。另外触发:UI 原型评审、线框图分析、设计点评、图表数据提取、物体识别、人/动物/活动识别。
io.github.MiniMax-AI/skills/shader-dev
全面的 GLSL 着色器技法,打造惊艳视觉效果——光线步进(ray marching)、SDF 建模、流体模拟、粒子系统、程序化生成、光照、后处理等。
io.github.MiniMax-AI/skills/react-native-dev
React Native 与 Expo 开发指南,覆盖组件、样式、动画、导航、状态管理、表单、网络请求、性能优化、测试、原生能力与工程化(项目结构、部署、SDK 升级、CI/CD)。适用场景:构建 React Native 或 Expo 应用、实现动画或原生 UI、管理状态、拉取数据、编写测试、优化性能、上架 App Store/Play Store、配置 CI/CD、升级 Expo SDK、配置 Tailwind/NativeWind。
io.github.MiniMax-AI/skills/pptx-generator
生成、编辑与读取 PowerPoint 演示文稿。使用 PptxGenJS 从零创建(封面、目录、内容、章节分隔、总结页),通过 XML 工作流编辑现有 PPTX,或使用 markitdown 提取文本。触发词:PPT、PPTX、PowerPoint、presentation、slide、deck、slides。
io.github.MiniMax-AI/skills/minimax-xlsx
打开、创建、读取、分析、编辑或校验 Excel/电子表格文件(.xlsx、.xlsm、.csv、.tsv)。当用户要求创建、构建、修改、分析、读取、校验或排版任何 Excel 表格、财务模型、数据透视表或表格数据文件时使用。覆盖:从零创建 xlsx、读取并分析现有文件、零格式损失地编辑现有 xlsx、公式重算与校验,以及套用专业财务排版标准。触发词:spreadsheet、Excel、.xlsx、.csv、pivot table、financial model、formula,或任何以 Excel 形式产出表格数据的请求。
io.github.MiniMax-AI/skills/minimax-pdf
当 PDF 的视觉质量与设计风格至关重要时使用本技能。CREATE(从零生成):「做个 PDF」「生成报告」「写份提案」「做简历」「精美 PDF」「正式文档」「封面页」「交付客户的文档」。FILL(填写表单域):「填表」「把这个 PDF 填完」「补全表单」「往 PDF 里写值」「这版 PDF 有哪些字段」。REFORMAT(套用设计):「重排这份文档」「套用我们的样式」「把 Markdown/文本转成 PDF」「让文档更好看」「重排样式」。本技能采用基于 token 的设计系统:色彩、字体与间距由文档类型推导并贯穿每一页,输出可直接印刷。当外观重要(而不仅仅是需要 PDF 输出)时优先使用。
io.github.MiniMax-AI/skills/minimax-music-playlist
根据用户的音乐口味与生成反馈历史,生成个性化音乐播放列表。任何涉及播放列表生成、音乐口味画像或个性化音乐推荐的请求都会触发。支持多语言触发。
io.github.MiniMax-AI/skills/minimax-music-gen
当用户想生成音乐、歌曲或音频曲目时使用。涉及音乐创作、写歌、歌词生成、音频制作或翻唱的任何请求都会触发;用户提供歌词并希望谱成歌曲,或描述某种情绪/场景并希望配乐时同样触发。支持多语言触发。不用于:播放已有音乐文件、乐理问题,或无生成需求的音乐推荐。
io.github.MiniMax-AI/skills/minimax-multimodal-toolkit
使用 mmx 通过 MiniMax AI 平台生成文本、图像、视频、语音与音乐。当用户想在终端里创作媒体内容、与 MiniMax 模型对话、执行网页搜索或管理 MiniMax API 资源时使用。
io.github.MiniMax-AI/skills/minimax-docx
基于 OpenXML SDK(.NET)的专业 DOCX 文档创建、编辑与排版。三条流水线:(A) 从零创建新文档,(B) 填充/编辑现有文档内容,(C) 套用模板格式化并通过 XSD 校验关卡检查。只要用户想产出、修改或排版 Word 文档就必须使用本技能——包括「写个报告」「起草方案」「做份合同」「填这张表」「按模板重排版」等说法;即便用户未明确提到 docx,只要任务最终交付是可打印/正式文档,也应使用本技能。
io.github.MiniMax-AI/skills/ios-application-dev
iOS 应用开发指南,覆盖 UIKit、SnapKit 与 SwiftUI。包含触控区域、安全区、导航模式、Dynamic Type、深色模式、无障碍、集合视图、常用组件与 SwiftUI 设计规范。具体主题的详细参考见引用文件。适用场景:开发 iOS 应用、实现 UI、审查 iOS 代码、处理 UIKit/SnapKit/SwiftUI 布局、构建 iPhone 界面、Swift 移动开发、遵循 Apple HIG、实现 iOS 无障碍。
io.github.MiniMax-AI/skills/gif-sticker-maker
将照片(人物、宠物、物体、logo)转换为 4 款带字幕的动态 GIF 贴纸。适用场景:制作卡通贴纸、GIF 表情包、emoji 包、动态头像,或把照片转成 Funko Pop / 泡泡玛特盲盒风格动画。触发词:sticker、GIF、cartoon、emoji、expression、头像动画。
io.github.MiniMax-AI/skills/fullstack-dev
全栈后端架构与前后端集成指南。触发时机:构建全栈应用、创建带前端的 REST API、搭建后端服务、待办应用、CRUD 应用、实时应用、聊天应用,Express + React、Next.js API、Node.js/Python/Go 后端,设计服务层、实现错误处理、管理配置/认证、接入 API 客户端、实现登录流程、处理文件上传、添加实时能力(SSE/WebSocket)、生产环境加固。不触发:纯前端 UI、纯 CSS/样式、仅数据库 schema。