原文标题: German AI consortium releases Soofi S, an open 30B model that tops benchmarks
原文内容:
德国AI联盟发布开源30B模型Soofi S,在多项基准测试中领先
更新: AI研究 复制链接到剪贴板 分享本文 跳转至评论区 德国AI联盟发布开源30B模型Soofi S,在英语和德语基准测试中均表现领先
查看Jonathan Kemper的LinkedIn资料 2026年7月13日 Nano Banana Pro 由 THE DECODER 提供提示
关键要点
- 一个德国研究联盟发布了开源语言模型Soofi S,该模型完全在德国电信的AI云基础设施上训练。
- 该模型采用资源高效的混合架构,每个token仅激活其316亿参数中的32亿,即使在超长输入下也能保持处理速度恒定。
- 由于重点使用了德语训练数据,Soofi S在德语、英语和编程任务的基准测试中,优于其他完全开源模型,如Olmo 3 32B和Apertus 70B。
就本文提问…… 搜索
更新 – 2026年7月15日: 添加关于过度训练指控的声明
2026年7月15日更新: 发布后,批评者认为,按照经典的Chinchilla缩放定律标准,Soofi S被严重“过度训练”。Google DeepMind于2022年发布了这些定律,描述了如何在固定计算预算下平衡模型大小和训练数据。他们确定的最佳平衡点大约是每个参数20个token。而Soofi S远远超过了这个比例。凭借约27万亿个token和300亿参数,其比例达到数百比一。如果仅考虑每个token活跃的32亿参数,这个比例更是跃升至数千比一。该项目技术领导团队成员Michael Fromm反驳了这一批评。他认为这些规则并不能简单地套用到混合专家(MoE)架构上。“有新的研究表明,来自密集模型的旧缩放定律不再适用于MoE架构,”Fromm说。原因在于MoE模型的构建方式。单个专家(expert)会从重复查看相同文档中受益,因此,与密集模型相比,大型高质量数据集中重复数据的问题要小得多。作为对比,Fromm指出Nvidia曾用高达25万亿个token训练自己的模型。
广告
2026年7月13日原文:
广告
DEC_D_Incontent-1
Soofi S是首批完全在慕尼黑德国电信工业AI云上训练的大型语言模型之一。这个开源的30B模型采用了精简的混合架构,并在训练数据混合中特意增加了德语的权重。
由德国人工智能协会(KI Bundesverband)协调的一个德国研究联盟发布了Soofi S 30B-A3B,这是一个开源语言模型。根据其预训练报告,该模型在完全开源模型中取得了英语和德语基准测试的最高分,超越了之前的领先者OLMo 3 32B和Apertus 70B。
广告
得益于其混合Mamba-Transformer架构,Soofi S即使在超长上下文下也能保持吞吐量,而像Apertus 70B和Qwen3 32B这样的密集模型则会急剧下降。| 图片来源:Soofi
为长上下文构建的精简架构
Soofi S是一个混合专家(MoE)模型。它总共包含316亿参数,但每个生成的token仅激活约32亿参数。这使得其计算成本更接近一个3B模型,而非传统的30B模型。该联盟直接采用了Nvidia Nemotron 3 Nano的架构,这是一种结合了Mamba-2层和标准注意力层的混合设计。与典型Transformer的关键区别在于内存行为。在传统模型中,用于注意力计算、存储先前token的KV缓存会随上下文长度线性增长。面对长输入和大量并行请求,重新加载该缓存会成为瓶颈。在Soofi S的52层中,只有6层维护了这样的缓存。
广告
DEC_D_Incontent-2
实际效果体现在生成吞吐量上。在上下文长度为40,000个token、32个并行请求的情况下,Soofi S每GPU每秒生成的token数量大约是参数在140亿到240亿范围内的密集模型的八倍。随着上下文增长,传统模型的吞吐量显著下降,而Soofi S在4,000到256,000个token范围内几乎保持平稳。在测量中,唯一表现出类似行为的模型是阿里巴巴的Qwen3.5 35B-A3B,它也使用了混合架构。
广告
围绕德语构建的训练数据混合
该联盟总共处理了约27万亿个token,分为三个阶段。在第一阶段,模型从大约20万亿个token中学习语言基础知识,这些token来自网络文本、代码、数学和特定领域文本的广泛混合。第二阶段紧随其后,使用约6万亿个来自更高质量来源的token,旨在强化之前学到的模式。然后,一个较短的第三阶段通过训练长达一百万个token的超长文档来扩展上下文窗口。
在三个训练阶段中,数据混合逐渐转向更高质量来源,并且德语数据的占比显著增加。| 图片来源:Soofi
对德语的刻意关注是核心。在第一阶段,德语占训练混合的7.2%;在第二阶段,这一比例上升到15.3%。而在Nvidia的Nemotron参考方案中,所有非英语语言加起来仅占约5%。在数据来源方面,该联盟结合了来自HPLT的德语网络文本、开源许可的德语Commons语料库、FinePDFs和FineWiki中的德语部分,以及商业许可的Genios语料库(包含来自916家德国出版物的1.93亿篇报纸文章)。机器翻译和合成生成的德语文本则补充了数据混合。
在德语和英语基准测试中均取得开源模型最高分
根据报告,在与16个其他开源模型的评估中,Soofi S在德语和英语的综合得分上均领先于所有完全开源模型。这包括来自艾伦人工智能研究所的OLMo 3 32B以及来自苏黎世联邦理工学院和洛桑联邦理工学院的Apertus 70B。在所有欧洲主权基准模型中,该模型在sui(原文此处截断)