【数字人应用基建】7个数字人生成及24个语音到文本ASR开源项目

文摘 2024-12-16 11:40 北京

今天是2024年12月16日，星期一，北京，天气晴。

今天，我们来看看语音方面的应用项目，讲两个内容，一个是7个数字人开源项目、一个是24个语音到文本项目，可以作为一个不错的索引，应该是比较全的。

供各位参考，多思考，多总结，多实践；

一、7个数字人开源项目

1、Fay

地址：https://github.com/xszyou/Fay

2、Sadtalker

地址：https://sadtalker.github.io/，https://modelscope.cn/studios/CVstudio/cv_human_portrait

3、Hallo

地址：https://fudan-generative-vision.github.io/hallo/#/，https://modelscope.cn/studios/AI-ModelScope/Hallo

4、EchoMimic/_v2

地址：https://badtobest.github.io/echomimic，https://modelscope.cn/studios/BadToBest/BadToBest，https://antgroup.github.io/ai/echomimic_v2/，https://github.com/antgroup/echomimic_v2

5、Wav2Lip

地址：https://github.com/Rudrabha/Wav2Lip

6、MuseTalk

地址：https://github.com/TMElyralab/MuseTalk

7、LivePortrait

地址：https://github.com/KwaiVGI/LivePortrait

二、24个语音到文本ASR开源项目

1）Moonshine

由UsefulSensors公司推出开源的模型，开源tiny版本，参数量:27M,只支持英文语言;开源base版本，参数量:61M,只支持英文语言;更快的处理速度，Moonshine的处理速度比Whisper快1.7倍。对于10秒的短音频片段，处理速度可达Whisper的五倍。基于20w小时的语音样本训练而来。

地址：https://github.com/usefulsensors/moonshine,https://hf-mirror.com/UsefulSensors/moonshine,https://arxiv.org/abs/2410.15608

2）Paraforme

由阿里达摩院出品的一个基础语音识别工具包，提供多种功能，包括语音识别（ASR）、语音端点检测（VAD）、标点恢复、语言模型、说话人验证、说话人分离和多人对话语音识别等。

地址：https://github.com/modelscope/FunASR,https://arxiv.org/abs/2206.08317,https://www.modelscope.cn/models/iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch/summary

3）Whisper-large-v3

由openai发布的一个预训练的自动语音识别（ASR）和语音翻译模型，在68万小时的标记数据上进行训练。

地址：https://hf-mirror.com/openai/whisper-large-v3

4）SenseVoice

SenseVoice-Small提供5种语言(中文、英文、日语、韩语、粤语)的低延迟ASR(目前已开源)，与Whisper-small(已开源)和Whisper-large相比，SenseVoice-Small的性能分别快5倍和15倍以上。,SenseVoice-Large支持超过50种语言的高精度ASR。提供情感识别能力（例如高兴、悲伤、生气等），能够检测音频中的特定事件，如音乐、掌声和笑声等。

地址：https://github.com/FunAudioLLM/SenseVoice,https://fun-audio-llm.github.io/pdf/FunAudioLLM.pdf,https://fun-audio-llm.github.io/,https://www.modelscope.cn/studios/iic/SenseVoice

5）Whisper-turbo

OpenAI重磅开源语言识别模型Whisper-turbo模型，是在lage-v3模型基础上微调的版本。模型更小，运行的速度更快。与原始模型相同，但解码层数从32减少到了4。turbo模型支持中文、英文在内的多种语言模型。

地址：https://hf-mirror.com/openai/whisper-large-v3-turbo

6）Qwen2_Audio

Qwen系列多模态大模型，支持超过8种语言和方言，例如中文、英语、粤语、法语、意大利语、西班牙语、德语和日语。可直接做ASR。

地址：https://github.com/QwenLM/Qwen2-audio,https://arxiv.org/abs/2407.107593,https://qwenlm.github.io/blog/qwen2-audio,https://hf-mirror.com/Qwen/Qwen2-Audio-7B-Instruct,https://www.modelscope.cn/studios/qwen/Qwen2-Audio-Instruct-Demo

7）FunASR

由阿里巴巴达摩院开发的一个开源自动语音识别(ASR)系统。

地址：https://github.com/alibaba/FunASR

8）ESPnet

ESPnet 是一个端到端的语音处理工具包，功能包含文本转语音、语音翻译、语音增强、说话者二值化、口语理解等等。

地址：https://github.com/espnet/espnet

9）DeepSpeech

嵌入式（离线、设备上）语音到文本引擎。

地址：https://github.com/mozilla/DeepSpeech，https://deepspeech.readthedocs.io/en/r0.9/，https://linux.cn/article-14233-1.html

10）PaddleSpeech

开源、易用、多合一的语音处理工具包，包含语音识别、语音翻译（英-中）、文本-语音、标点恢复功能。

地址：https://github.com/PaddlePaddle/PaddleSpeech

11）MASRMASR

中文普通话语音识别项目，同时兼容在线和离线识别

地址：https://github.com/nobody132/masr，https://blog.csdn.net/HELLOWORLD2424/article/details/12366787

12）SpeechBrain

支持语音识别系统，说话人识别、鉴定和记录，语音增强，语音分离，语言识别，语言翻译等。支持语言：中文。

地址：https://github.com/speechbrain/speechbrain

13）WeNetWeNet

更关注无监督自学习、设备端模型探索和优化。

地址：https://github.com/wenet-e2e/wenet，https://arxiv.org/abs/2203.15455

14）ESPnet

端到端的语音处理工具包，功能包含文本转语音、语音翻译、语音增强、说话者二值化、口语理解等等。

地址：https://github.com/espnet/espnet

15）ASRT

中文语音识别系统，在训练中使用了大量中文语音数据，将声音转录为中文拼音，并支持通过语言模型，将拼音序列转换为中文文本。

地址：https://github.com/nl8590687/ASRT_SpeechRecognition

16）Massively Multilingual Speech

Meta开源，识别4000多种口头语言并生成1100多种语。

地址：https://research.facebook.com/publications/scaling-speech-technology-to-1000-languages/，https://github.com/facebookresearch/fairseq/blob/main/examples/mms/README.md，https://ai.meta.com/blog/multilingual-model-speech-recognition

17）OpenSeq2Seq

由Nvidia开发，可进行转录，翻译，自动语音识别和情感分析。

地址：https://github.com/NVIDIA/OpenSeq2Seq

18）Vosk

可以在多种设备上离线运行，包括Android、iOS和Raspberry Pi，支持20多种语言或方言，包括：英语、中文、葡萄牙语、波兰语、德语等，提供了小型语言模型，理想情况下，大约只有50MB。

地址：https://github.com/alphacep/vosk-api

19）Tensorflow ASR

支持Conformer、ContextNet、DeepSpeech2和Jasper等方案。

地址：https://github.com/TensorSpeech/TensorFlowASR

20）Athena

支持自动语音识别（ASR）、语音合成、语音检测和关键字定位等功能。

地址：https://github.com/athena-team/athena

21）Flashlight ASR

由Facebook AI研究团队设计的开源语音识别工具包，使用C++编译。

地址：https://github.com/flashlight/wav2letter

22）Reverb

在长语音识别上，官方比Whisper large-v3、NVIDIA Canary-1B优秀，基于20万小时人工转录英语数据上训练，在长语音识别方面优秀，特别适合播客、财报电话会议等场景。

地址：https://github.com/revdotcom/reverb/tree/main/asr

23）KaldiTTS

应用于大学课程、语音研究和商业部署。

地址：https://github.com/kaldi-asr/kaldi，https://kaldi-asr.org/

24）Coqui Transcripts

Deepspeech和Deepspeech2项目原先团队出品。

地址：https://github.com/coqui-ai/STT

关于我们

老刘，NLP开源爱好者与践行者，主页：https://liuhuanyong.github.io。

对大模型&知识图谱&RAG&文档理解感兴趣，并对每日早报、老刘说NLP历史线上分享、心得交流等感兴趣的，欢迎加入社区，社区持续纳新。

加入会员方式：关注公众号，在后台菜单栏中点击会员社区->会员入群加入

老刘说NLP

老刘，NLP开源爱好者与践行者。主页：https://liuhuanyong.github.io。老刘说NLP，将定期发布语言资源、工程实践、技术总结等内容，欢迎关注。

最新文章

大模型用于情报分析时间线生成(TLS)任务：根本问题及两个代表工作

OCR噪声对RAG性能的影响分析：兼谈公众号文章的价值正确定位

60k感知算法岗面试，考察热门Occ算法及难点！

技术实践指引：3个适合练手的开源数据及项目平台

语音处理落地组件全家桶：语音大模型、数字人、语音到文本、文本转语音全集

老刘说NLP社区2024年终演讲：回顾得失，踏实前行

GraphRAG范式的新角度思考及一个很有信息量的总结

大模型4大神书《动手学大语言模型之语言理解和生成》分享

RAG落地端侧场景：EdgeRAG面向端侧RAG优化思路及特定领域多模态探索

2025年开篇：技术及宏观角度回顾2024年大模型发展

老刘说NLP及大模型的2024年终总结—不悲不喜、继续前行

GraphRAG前沿进展：引入本体的OG-RAG及HYBGRAG实现思路

大模型与知识图谱结合之三元组预测及GEAR多跳问答思路

老刘说NLP技术社区共享：围绕知识图谱+大模型+文档智能三驾马车前进

多模态RAG中的图文Embedding模型及8个图文对数据集

Prompt自动优化框架PromptWizard及AI搜索框架Level-Navi Agent实现思路

RAG的4种查询优化思路及用于时序预测的2个工作

又看多模态RAG进展：解读OmniSearch-多模态检索增强生成新SOTA！

大模型用于推荐(LLMERS)范式总结及缓存增强生成（CAG）实现思路

打破记录！“真心建议” 大家读一下这篇《Nature》重磅文章

再看情报分析中的事件名称生成策略：基于最长公共子串思想原理

两个值得一读的技术总结：OpenAI o1模型复现复现思想及多模态大模型用于数学推理

langchain关于Agent的年终统计及文档图片去水印思路

文档智能遇上历史古籍：古籍文档修复及识别开源数据集

再看多模态RAG进展：VisDoMRAG及DocVLM-OCR方案解读

《一书解决几乎所有机器学习问题》.PDF下载

【数字人应用基建】29个文本转语音TTS开源工具

大模型人才的薪资，彻底爆了！

【数字人应用基建】7个数字人生成及24个语音到文本ASR开源项目

RAG常见模式、痛点及最佳实践总结4张图：兼看大模型时代的工程开发工具集合

RAG＆KG＆LLM＆文档智能等前沿技术及落地跟进：老刘说NLP技术社区持续对外纳新

RAG年终总结之12篇综述：从2022到2024看架构、策略、评测及演化

大模型行业，岗位也分三六九等

【RAG 2024时间线回顾】RAG七十二式：2024年度RAG清单索引

卷图不卷图谱-GraphRAG最近趋势：考虑结构性、相似性、相关性等Graph思想实现策略

视觉语言模型新SOTA！性能碾压LoRA，无需预训练，训练显存大大减少！

文档处理之E2M转Markdown工具及BigDocs大规模通用文档数据集

RAG＆KG＆LLM＆文档智能等前沿技术及落地跟进：老刘说NLP技术社区持续对外纳新

【前沿进展】文档多模态嵌入表示方案DSE、数据合成及AI搜索应用新风向

AI生成文本检测数据集及9个工具索引：兼看“磁悬浮老鹰”逻辑陷进测试

RAG用于翻译实现思路及多模态模型用于文档理解的几个核心问题

【文档智能】多模态文档OCR评测CC-OCR及专有模型代表工作

aiops-challenge比赛简单总结

故障分析怎么做？朴素KG方案及LLM+Graph RAG方案实现思路

yyds！哈工大博士的PyTorch笔记火了！！

ChatGPT两周年历程回顾及大模型Text2SQL方案索引

王者归来！白皮书《从头训练大模型最佳实践》开源了。。。

12个开源AI搜索引擎项目及关于Ai搜索的一些思考

AUTO-RAG多轮对话迭代式检索及RAGDiffusion多模态图像生成思路

使用LLM进行标书写作简单开源项目及openai O1实现思路再索引

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉