← 返回日报
🌐 机器翻译 · DeepSeek · GitHub

microsoft VibeVoice


微软 VibeVoice

🎙️ VibeVoice:开源前沿语音 AI

📰 新闻

2026-07-23: ⚡ 我们发布了 VibeVoice-ASR-BitNet,这是一个面向 VibeVoice-ASR 的边缘 CPU 推理引擎。通过异构量化(I8_S + I2_S),模型从 4.62 GB 压缩至 1.58 GB,并在 3 个以上 CPU 线程上实现实时推理(RTF < 1),无需 GPU。[代码] [模型] [报告]

2026-03-12: 🚀 VibeVoice-ASR 现已集成到 Azure AI Foundry Labs!您现在可以直接通过 Microsoft Foundry 探索和测试我们统一的语音转文本能力。

2026-03-06: 🚀 VibeVoice ASR 现已成为 Transformers 版本的一部分!您现在可以直接通过 Hugging Face Transformers 库使用我们的语音识别模型,无缝集成到您的项目中。

2026-01-21: 📣 我们开源了 VibeVoice-ASR,这是一个统一的语音转文本模型,能够单次处理长达 60 分钟的长音频,生成包含“谁”(说话人)、“何时”(时间戳)和“什么”(内容)的结构化转录,并支持用户自定义上下文。在 Playground 中试用。

⭐️ VibeVoice-ASR 原生支持多语言,覆盖 50 多种语言——详情请查看支持的语言列表。

🔥 VibeVoice-ASR 微调代码现已可用!

⚡️ 现已支持 vLLM 推理以实现更快的推理速度;更多详情请参见 vllm-asr。

📑 VibeVoice-ASR 技术报告已发布。

2025-12-16: 📣 我们为 VibeVoice‑Realtime‑0.5B 添加了实验性音色供探索,包括九种语言(德语、法语、意大利语、日语、韩语、荷兰语、波兰语、葡萄牙语、西班牙语)的多语言声音和 11 种不同的英语风格声音。立即试用。未来将添加更多音色类型。

2025-12-03: 📣 我们开源了 VibeVoice‑Realtime‑0.5B,这是一个实时文本转语音模型,支持流式文本输入和稳健的长语音生成。在 Colab 上试用。

2025-09-05: VibeVoice 是一个开源研究框架,旨在促进语音合成社区的协作。发布后,我们发现该工具在某些场景下的使用方式与既定意图不符。由于负责任地使用 AI 是微软的指导原则之一,我们已从本仓库中移除了 VibeVoice-TTS 代码。

2025-08-25: 📣 我们开源了 VibeVoice-TTS,这是一个长语音多说话人文本转语音模型,能够合成长达 90 分钟的语音,支持最多 4 个不同的说话人。——已被 ICLR 2026 接收为 Oral 论文!

🔥 概述

VibeVoice 是一个开源前沿语音 AI 模型系列,包含文本转语音(TTS)和自动语音识别(ASR)模型。VibeVoice 的一项核心创新是使用了以 7.5 Hz 超低帧率运行的连续语音分词器(声学与语义)。这些分词器在高效保留音频保真度的同时,显著提升了处理长序列的计算效率。

VibeVoice 采用下一词元扩散框架,利用大语言模型(LLM)理解文本上下文和对话流程,并通过扩散头生成高保真声学细节。更多信息、演示和示例,请访问我们的项目页面。

模型权重快速试用

模型

1. 📖 VibeVoice-ASR - 长语音识别

VibeVoice-ASR 是一个统一的语音转文本模型,能够单次处理长达 60 分钟的长音频,生成包含“谁”(说话人)、“何时”(时间戳)和“什么”(内容)的结构化转录,并支持自定义热词

📖 文档 | 🤗 Hugging Face | 🎮 Playground | 🛠️ 微调 | 📊 论文

small.mp4

2. 🎙️ VibeVoice-TTS - 长语音多说话人 TTS

最佳适用场景:长语音对话音频、播客、多说话人对话

📖 文档 | 🤗 Hugging Face | 📊 论文

English ES_._3.mp4 Chinese default.mp4 Cross-Lingual 1p_EN2CH.mp4 Spontaneous Singing 2p_see_u_again.mp4 Long Conversation with 4 people 4p_climate_45min.mp4

3. ⚡ VibeVoice-Streaming - 实时流式 TTS

VibeVoice-Realtime 是一个轻量级实时文本转语音模型,支持流式文本输入和稳健的长语音生成。

📖 文档 | 🤗 Hugging Face | 🚀 Colab

VibeVoice_Realtime.mp4

贡献

请参阅 CONTRIBUTING.md 了解详细的贡献指南。

⚠️ 风险与限制

尽管已通过多种技术努力进行优化,该模型仍可能产生意外、有偏见或不准确的输出。VibeVoice 继承了其训练数据及生成过程中可能存在的任何偏见、错误或遗漏。

📖 阅读原文 →