当全世界都在谈论海量数据集时,俄罗斯联邦储蓄银行Sber却提出了相反的主张。基础模型技术总监费奥多尔·明金展示了新版本的GigaChat 3.5 Ultra,该模型体积缩小一倍,但速度显著提升。这不仅仅是一次更新,而是理念的转变——该银行押注“线性注意力”。得益于这一架构,模型在处理长文档时不再受“内存占满”的困扰,这对企业级应用至关重要。

我们押注线性注意力——这项技术让模型能够一次性记住所读内容的要点,并在工作过程中不断补充记忆。这使模型在处理长文本时速度最高提升四倍。此外,我们将模型体积缩小了近一半——这意味着部署更便宜、更容易。当时尚不确定我们能否在提升速度、缩小体积的同时保持模型的智能和质量。我们进行了超过1500次实验,以找到正确的平衡——最终推出了目前开源领域中规模最大的线性注意力模型之一。
对话探讨了当今AI合理扩展的边界在哪里。专家强调,与高昂的计算成本相比,增加参数带来的质量提升正在递减。GigaChat 3.5 Ultra是对市场对可负担、快速且不牺牲智能的AI需求的回应。Sber团队是俄罗斯唯一向市场分享其成果的团队:公开架构和训练检查点旨在加速整个社区的发展。
模型规模每向上提升一步,其成本都不成比例地高于前一步,到了某个节点,公司为换取微小的质量提升而耗费巨额资源。我们通过效率来界定这个边界——即模型在单位算力下能带来多少实际价值。GigaChat 3.5 Ultra的体积比上一版本缩小近一半,但在多项指标上已接近远为庞大的开源模型(如DeepSeek 3.2)的结果。这意味着,只要架构和数据选择得当,较小的体型完全能与较大的模型竞争。行业目前正经历一个重要转折:今天,更关键的是谁能通过精妙的工程从现有资源中榨取最大价值。对我而言,合理扩展首先是一个如何审慎支配每一次计算的问题。
对话中提到的未来展望不仅限于Transformer。扩散模型尤其引人关注,它可能彻底改变生成速度。同样重要的还有关于合成数据的观点:人工文本适用于数学问题,但真实的人类专业知识仍是不可替代的资源。该文章展示了一家欧洲开发商如何在AI军备竞赛中定位自己——强调工程能力,而非无休止的规模扩张。

人工生成的数据仍是模型质量的主要资源——只有它们才承载真正的专业经验和人类思维与发现意外方案的鲜活多样性。合成数据在需要精度和规模而非多样性的场景中表现良好,例如训练数学或代码的逻辑推理。但如果合成数据成为世界知识的主要来源,而非精准工具,模型就会开始从自身的反射中学习:一个模型的错误和模式会固化到另一个模型中,文本变得缺乏生气。因此,在新模型的训练数据集中,我们侧重了经过精心筛选的人工撰写文本。