【数字人应用基建】29个文本转语音TTS开源工具

文摘 2024-12-17 10:30 北京

今天是2024年12月17日，星期二，北京，天气晴。

今天，我们继续来看看语音方面的应用项目，讲29个文本转语音的项目，可以作为一个不错的索引，应该是比较全的。

供各位参考，多思考，多总结，多实践；

29个文本转语音TTS开源工具

1）TTS Maker

地址：https://ttsmaker.com/zh-cn 支持多种语言和不同的声音选项（包括：中文、英语、日语、法语、阿拉伯语、韩语等等，甚至转换成方言：包括东北话、粤语、闽南话等等。

2）微软Azure

地址：https://azure.microsoft.com/en-us/products/cognitive-services/text-to-speech/

微软出品的一种语音服务功能。

3）PaddleSpeech

地址：https://github.com/PaddlePaddle/PaddleSpeech

基于PaddlePaddle深度学习平台。提供了基于 FastSpeech2 声学模型和 HiFiGAN 声码器的中文流式语音合成系统。

4）VoiceVox

地址：https://github.com/VOICEVOX/voicevox

基于VOICEVOX的OSS（开源软件）版本构建，软件部分是Electron + Vue

5）TensorFlowTTS

地址：https://github.com/TensorSpeech/TensorFlowTTS

包含了一系列深度学习模型，如FastSpeech 2、Tacotron 2、Multi-band MelGAN等。

6）TTSKit

地址：https://github.com/kuangdd/ttskit

集成多种开源TTS技术和模型，如Tacotron 2、WaveNet、WaveGlow等。

7）OpenTTS

地址：https://github.com/synesthesiam/opentts

整合和利用了现有的开源TTS引擎（如Mozilla的TTS、MaryTTS、eSpeak NG等）和语音合成方案。

8）eSpeak NG

地址：https://github.com/espeak-ng/espeak-ng

eSpeak的一个分支。

9）F5-TTS

上海交通大学开源的一款高性能文本到语音（TTS）系统，基于流匹配的非自回归生成方法，结合扩散变换器（DiT）技术。零样本声音克隆，可以控制合成语音的情感色彩。

地址：：https://github.com/SWivid/F5-TTS HuggingFace，https://huggingface.co/SWivid/F5-TTS，https://arxiv.org/pdf/2410.06885，https://huggingface.co/spaces/mrfakename/E2-F5-TTS

10）Edge-TTS

微软推出的工具，支持英语、汉语、日语、韩语、法语等40多种语言，共300多种可选声音。

地址：https://github.com/rany2/edge-tts

11）ChatTTS

支持中英文对话的文本到语音TTS模型，超过10万小时的训练，公开版本在HuggingFace上提供了一个4万小时预训练的模型。

地址：https://github.com/2noise/ChatTTS

12）ChatTTS-ui

在网页使用ChatTTS将文字合成为语音，使用前端口展示。集成了批量语音到字幕、批量字幕翻译和批量配音小工具。

地址：https://github.com/jianchang512/ChatTTS-ui

13）Seed-TTS

字节跳动开发的支持语音内容编辑和说话速度编辑的工具。

地址：https://bytedancespeech.github.io/seedtts_tech_report/，https:/arxiv.org/pdf/2406.02430，https://github.com/BytedanceSpeech/seed-tts-eval/

14）Fish Speech

使用约十五万小时三语数据训练，可处理和生成中文、日语和英语的语音。支持多种不同的语音生成模型，包括VITS2、Bert-VITS2、GPT VITS、MQTTS、GPT Fast、GPT-SOVITS。

地址：https://github.com/fishaudio/fish-speech，https://fish.audio/zh-CN/

15）GPT-SoVITS

集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注。

地址：https://github.com/RVC-Boss/GPTSoVITS

16）OpenVoice

My ShellITTS开发，可进行声音克隆。对声音风格的精细控制，包括情感、口音、节奏、停顿和语调，支持英语、西班牙语、法语、中文、日语和韩语。

地址：https://github.com/myshell-ai/OpenVoice，https://arxiv.org/pdf/2312.01479.pdf

**17）Parler-TTS **

支持性别、音调、说话风格等控制生成语音。

地址：https://github.com/huggingface/parler-tts

18）FUNAudioLLM-CosyVoice

CosyVoice使用自然语音生成和控制，支持多种语言、音色和说话风格的生成。

地址：https://github.com/FunAudioLLM/CosyVoice

19）VoiceCraft

支持克隆语音和修改音频文本。

地址：https://github.com/jasonppy/VoiceCraft

20）EmotiVoice

支持中英文双语，包含2000多种不同的音色，以及特色的情感合成功能，基于Tacotron和WaveRNN模型。

地址：https://github.com/netease-youdao/EmotiVoice

21）MetaVoice-1B

一个1.28参数，在100K小时的语音上训练。

地址：https://github.com/metavoiceio/metavoice-src

22）Voice Engine

OpenAl发布，能够利用简短的15秒音频样本和文本输入，生成原声。

地址：https://ai-bot.cn/openai-voice-engine/

23）Bark

由Suno创建的基于转换器的文本到音频模型，可以生成高度逼直的多语言语音以及其他音频，包括音乐、背景噪音和简单的音效。

地址：https://github.com/suno-ai/bark

24）MaskGCT

趣丸科技&香港中文大学提出的完全非自回归的TTS模型，采用掩码生成编解码器变换器（MaskGCT）。

地址：https://hf-mirror.com/amphion/MaskGCT

25）Coqui TTS

提供了超过1100种语言的预训练模型。

地址：https://github.com/coqui-ai/tts，https://huggingface.co/spaces/coqui/xtts，https://tts.readthedocs.io/en/dev/models/xtts.html

26）So-VITS-SVC

将一种歌声转换为另一种目标歌手的声音，广泛应用于音乐创作、虚拟歌手的声音生成等领域。

地址：https://github.com/svc-develop-team/so-vits-svc

27）Mocking Bird

开发者@babysor开源的AI拟声开源项目。

地址：https://github.com/babysor/MockingBird，https://www.bilibili.com/video/BV17Q4y1B7mY

28）Real-Time-Voice-Cloning

提供了GUI界面，交互傻瓜式操作，语音采集、训练、生成都可以交互完成。

地址：https://github.com/CorentinJ/Real-Time-Voice-Cloning

29）voice-pro

使用UVR5支持的MDX-Net和Meta开发的Demucs引擎进行语音分离；支持使用Whisper、Faster-Whisper和whisper-timestamped进行语音转文字。翻译器使用Google翻译。短文翻译，字幕文件翻译。TTS采用Edge-TTS。zero-shot语音克隆的E2和F5-TTS。

地址：https://github.com/abus-aikorea/voice-pro

关于我们

老刘，NLP开源爱好者与践行者，主页：https://liuhuanyong.github.io。

对大模型&知识图谱&RAG&文档理解感兴趣，并对每日早报、老刘说NLP历史线上分享、心得交流等感兴趣的，欢迎加入社区，社区持续纳新。

加入会员方式：关注公众号，在后台菜单栏中点击会员社区->会员入群加入

老刘说NLP

老刘，NLP开源爱好者与践行者。主页：https://liuhuanyong.github.io。老刘说NLP，将定期发布语言资源、工程实践、技术总结等内容，欢迎关注。

最新文章

大模型用于情报分析时间线生成(TLS)任务：根本问题及两个代表工作

OCR噪声对RAG性能的影响分析：兼谈公众号文章的价值正确定位

60k感知算法岗面试，考察热门Occ算法及难点！

技术实践指引：3个适合练手的开源数据及项目平台

语音处理落地组件全家桶：语音大模型、数字人、语音到文本、文本转语音全集

老刘说NLP社区2024年终演讲：回顾得失，踏实前行

GraphRAG范式的新角度思考及一个很有信息量的总结

大模型4大神书《动手学大语言模型之语言理解和生成》分享

RAG落地端侧场景：EdgeRAG面向端侧RAG优化思路及特定领域多模态探索

2025年开篇：技术及宏观角度回顾2024年大模型发展

老刘说NLP及大模型的2024年终总结—不悲不喜、继续前行

GraphRAG前沿进展：引入本体的OG-RAG及HYBGRAG实现思路

大模型与知识图谱结合之三元组预测及GEAR多跳问答思路

老刘说NLP技术社区共享：围绕知识图谱+大模型+文档智能三驾马车前进

多模态RAG中的图文Embedding模型及8个图文对数据集

Prompt自动优化框架PromptWizard及AI搜索框架Level-Navi Agent实现思路

RAG的4种查询优化思路及用于时序预测的2个工作

又看多模态RAG进展：解读OmniSearch-多模态检索增强生成新SOTA！

大模型用于推荐(LLMERS)范式总结及缓存增强生成（CAG）实现思路

打破记录！“真心建议” 大家读一下这篇《Nature》重磅文章

再看情报分析中的事件名称生成策略：基于最长公共子串思想原理

两个值得一读的技术总结：OpenAI o1模型复现复现思想及多模态大模型用于数学推理

langchain关于Agent的年终统计及文档图片去水印思路

文档智能遇上历史古籍：古籍文档修复及识别开源数据集

再看多模态RAG进展：VisDoMRAG及DocVLM-OCR方案解读

《一书解决几乎所有机器学习问题》.PDF下载

【数字人应用基建】29个文本转语音TTS开源工具

大模型人才的薪资，彻底爆了！

【数字人应用基建】7个数字人生成及24个语音到文本ASR开源项目

RAG常见模式、痛点及最佳实践总结4张图：兼看大模型时代的工程开发工具集合

RAG＆KG＆LLM＆文档智能等前沿技术及落地跟进：老刘说NLP技术社区持续对外纳新

RAG年终总结之12篇综述：从2022到2024看架构、策略、评测及演化

大模型行业，岗位也分三六九等

【RAG 2024时间线回顾】RAG七十二式：2024年度RAG清单索引

卷图不卷图谱-GraphRAG最近趋势：考虑结构性、相似性、相关性等Graph思想实现策略

视觉语言模型新SOTA！性能碾压LoRA，无需预训练，训练显存大大减少！

文档处理之E2M转Markdown工具及BigDocs大规模通用文档数据集

RAG＆KG＆LLM＆文档智能等前沿技术及落地跟进：老刘说NLP技术社区持续对外纳新

【前沿进展】文档多模态嵌入表示方案DSE、数据合成及AI搜索应用新风向

AI生成文本检测数据集及9个工具索引：兼看“磁悬浮老鹰”逻辑陷进测试

RAG用于翻译实现思路及多模态模型用于文档理解的几个核心问题

【文档智能】多模态文档OCR评测CC-OCR及专有模型代表工作

aiops-challenge比赛简单总结

故障分析怎么做？朴素KG方案及LLM+Graph RAG方案实现思路

yyds！哈工大博士的PyTorch笔记火了！！

ChatGPT两周年历程回顾及大模型Text2SQL方案索引

王者归来！白皮书《从头训练大模型最佳实践》开源了。。。

12个开源AI搜索引擎项目及关于Ai搜索的一些思考

AUTO-RAG多轮对话迭代式检索及RAGDiffusion多模态图像生成思路

使用LLM进行标书写作简单开源项目及openai O1实现思路再索引

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉