微软 VibeVoice
🎙️ VibeVoice:开源前沿语音 AI
📰 新闻
2026-07-23: ⚡ 我们发布了 VibeVoice-ASR-BitNet,这是一个面向 VibeVoice-ASR 的边缘 CPU 推理引擎。通过异构量化(I8_S + I2_S),模型从 4.62 GB 压缩至 1.58 GB,并在 3 个以上 CPU 线程上实现实时推理(RTF < 1),无需 GPU。[代码] [模型] [报告]
2026-03-12: 🚀 VibeVoice-ASR 现已集成到 Azure AI Foundry Labs!您现在可以直接通过 Microsoft Foundry 探索和测试我们统一的语音转文本能力。
2026-03-06: 🚀 VibeVoice ASR 现已成为 Transformers 版本的一部分!您现在可以直接通过 Hugging Face Transformers 库使用我们的语音识别模型,无缝集成到您的项目中。
2026-01-21: 📣 我们开源了 VibeVoice-ASR,这是一个统一的语音转文本模型,能够单次处理长达 60 分钟的长音频,生成包含“谁”(说话人)、“何时”(时间戳)和“什么”(内容)的结构化转录,并支持用户自定义上下文。在 Playground 中试用。
⭐️ VibeVoice-ASR 原生支持多语言,覆盖 50 多种语言——详情请查看支持的语言列表。
🔥 VibeVoice-ASR 微调代码现已可用!
⚡️ 现已支持 vLLM 推理以实现更快的推理速度;更多详情请参见 vllm-asr。
📑 VibeVoice-ASR 技术报告已发布。
2025-12-16: 📣 我们为 VibeVoice‑Realtime‑0.5B 添加了实验性音色供探索,包括九种语言(德语、法语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、西班牙语)的多语言声音和 11 种不同的英语风格声音。立即试用。未来将添加更多音色类型。
2025-12-03: 📣 我们开源了 VibeVoice‑Realtime‑0.5B,这是一个实时文本转语音模型,支持流式文本输入和稳健的长语音生成。在 Colab 上试用。
2025-09-05: VibeVoice 是一个开源研究框架,旨在促进语音合成社区的协作。发布后,我们发现该工具在某些场景下的使用方式与既定意图不符。由于负责任地使用 AI 是微软的指导原则之一,我们已从本仓库中移除了 VibeVoice-TTS 代码。
2025-08-25: 📣 我们开源了 VibeVoice-TTS,这是一个长语音多说话人文本转语音模型,能够合成长达 90 分钟的语音,支持最多 4 个不同的说话人。——已被 ICLR 2026 接收为 Oral 论文!
🔥 概述
VibeVoice 是一个开源前沿语音 AI 模型系列,包含文本转语音(TTS)和自动语音识别(ASR)模型。VibeVoice 的一项核心创新是使用了以 7.5 Hz 超低帧率运行的连续语音分词器(声学与语义)。这些分词器在高效保留音频保真度的同时,显著提升了处理长序列的计算效率。
VibeVoice 采用下一词元扩散框架,利用大语言模型(LLM)理解文本上下文和对话流程,并通过扩散头生成高保真声学细节。更多信息、演示和示例,请访问我们的项目页面。
模型权重快速试用
- VibeVoice-ASR-7B:HF 链接 | Playground
- VibeVoice-ASR-BitNet (CPU):HF 链接 | VibeASR.cpp
- VibeVoice-TTS-1.5B:HF 链接 | 已禁用
- VibeVoice-Realtime-0.5B:HF 链接 | Colab
模型
1. 📖 VibeVoice-ASR - 长语音识别
VibeVoice-ASR 是一个统一的语音转文本模型,能够单次处理长达 60 分钟的长音频,生成包含“谁”(说话人)、“何时”(时间戳)和“什么”(内容)的结构化转录,并支持自定义热词。
- 🕒 60 分钟单次处理:与传统 ASR 模型将音频切分为短片段(常丢失全局上下文)不同,VibeVoice ASR 可在 64K 词元长度内接受长达 60 分钟的连续音频输入。这确保了在整个时长内一致的说话人追踪和语义连贯性。
- 👤 自定义热词:用户可以提供自定义热词(例如特定名称、技术术语或背景信息)来引导识别过程,显著提升领域特定内容的准确率。
- 📝 丰富转录(谁、何时、什么):该模型联合执行 ASR、说话人日志和时间戳生成,输出结构化结果,指明谁在何时说了什么。
📖 文档 | 🤗 Hugging Face | 🎮 Playground | 🛠️ 微调 | 📊 论文
small.mp4
2. 🎙️ VibeVoice-TTS - 长语音多说话人 TTS
最佳适用场景:长语音对话音频、播客、多说话人对话
- ⏱️ 90 分钟长语音生成:单次合成最长 90 分钟的对话/单人语音,全程保持说话人一致性和语义连贯性。
- 👥 多说话人支持:支持单个对话中最多 4 个不同说话人,在长对话中实现自然的轮流发言和说话人一致性。
- 🎭 富有表现力的语音:生成富有表现力、自然流畅的语音,捕捉对话动态和情感细微差别。
- 🌐 多语言支持:支持英语、中文及其他语言。
📖 文档 | 🤗 Hugging Face | 📊 论文
English ES_._3.mp4 Chinese default.mp4 Cross-Lingual 1p_EN2CH.mp4 Spontaneous Singing 2p_see_u_again.mp4 Long Conversation with 4 people 4p_climate_45min.mp4
3. ⚡ VibeVoice-Streaming - 实时流式 TTS
VibeVoice-Realtime 是一个轻量级实时文本转语音模型,支持流式文本输入和稳健的长语音生成。
- 参数量:0.5B(易于部署)
- 实时 TTS(约 300 毫秒首次可听延迟)
- 流式文本输入
- 稳健的长语音生成(约 10 分钟)
📖 文档 | 🤗 Hugging Face | 🚀 Colab
VibeVoice_Realtime.mp4
贡献
请参阅 CONTRIBUTING.md 了解详细的贡献指南。
⚠️ 风险与限制
尽管已通过多种技术努力进行优化,该模型仍可能产生意外、有偏见或不准确的输出。VibeVoice 继承了其训练数据及生成过程中可能存在的任何偏见、错误或遗漏。