OpenAI 开源的通用语音识别模型,支持多语言转写与翻译。
🎙️ 语音与音频
语音识别、语音合成、音色克隆与音乐生成
仅需几秒到一分钟语音即可克隆音色并合成的 TTS 工具。
通义实验室的多语言语音合成大模型,支持零样本音色克隆。
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
The open-source AI voice studio. Clone, dictate, create.
Open-Source Frontier Voice AI
Whisper 的 C/C++ 移植,可在 CPU、手机和浏览器里运行。
深度学习文本转语音工具包,模型丰富。
面向日常对话场景的生成式语音模型,中英文自然流畅。
文本生成高度逼真的多语种语音、音乐与音效。
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
即时语音克隆,可灵活控制语气与风格。
开源的多语言文本转语音,支持零样本克隆。
Resemble AI 开源的 TTS 模型,支持情感控制。
基于 CTranslate2 的 Whisper 重实现,速度快 4 倍且更省内存。
带词级时间戳与说话人分离的快速 Whisper 转写。
B 站开源的工业级零样本语音合成系统。
Meta 的音频生成库,含 MusicGen 与 AudioGen。
YC (S26) | Open Computer History | Continuously record your company computer work, map your workflows, help you find work worth automating, and power your agents' context
阿里达摩院的端到端语音识别工具包,中文效果出色。
视频翻译配音工具:识别、翻译、配音与字幕合成。
A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)
流匹配的流畅忠实语音合成。
离线语音识别/合成/说话人识别,覆盖手机、嵌入式与浏览器。