十万亿参数豪赌:字节跳过“捷径”死磕底层,张一鸣的长期主义底气何在?

   发布时间:2026-08-08 07:31 作者:江紫萱

近日,字节跳动创始人张一鸣在公司内部全员会上明确表态,拒绝通过“蒸馏”技术追赶前沿大语言模型。他强调,公司应着眼于长远目标,即使需要牺牲短期利益,也要坚持自主训练大模型。这一决策引发行业广泛关注,尤其是在中国大模型竞争格局加速演变的背景下。

当前,中国大模型领域竞争激烈。最新全球LLM排行榜显示,月之暗面Kimi K3 Max位列第二,阿里Qwen 3.8 Max位居第四,智谱GLM 5.2 Max和DeepSeek V4 Flash分列第七、第八。相比之下,字节跳动的Seed 2.1 Pro仅排在第21位,与国内其他领先模型存在明显差距。尽管字节跳动在资金、人才、算力和数据等方面具备显著优势,但其大模型发展却未能达到预期水平。

据了解,字节跳动内部曾多次就是否采用“蒸馏”技术展开激烈讨论。这种技术通过借鉴其他大模型的输出结果来训练自身模型,被视为快速提升性能的捷径。然而,张一鸣三次否决了相关提议。第一次是在2025年1月,面对DeepSeek-R1的强势崛起,他坚持Seed模型应学习“如何思考”而非模仿他人;第二次是在英伟达Blackwell芯片部署后,尽管算力差距扩大,他仍选择追加2000亿元投资建设智算中心;第三次则是在Kimi K3等模型带来竞争压力时,他再次强调榜单排名是虚的,商业主权才是实的。

“蒸馏”技术虽能快速提升模型在基准测试中的分数,但存在显著缺陷。牛津、剑桥等机构的研究表明,反复使用AI生成的数据训练模型会导致“模型坍缩”,即原始数据分布中的尾部信息逐渐消失,最终引发能力退化。这种“近亲繁殖”效应会使模型变得越来越狭隘,虽然基准测试分数可能持续上升,但处理未知问题的能力却会下降。对于字节跳动而言,其拥有的抖音、TikTok等平台产生的海量原生数据,才是训练大模型最宝贵的资源。

从技术架构层面看,字节跳动坚持从头训练大模型还有更深层次的考虑。词表作为模型的“眼睛”,决定了模型对语言的切分和理解方式。使用他人词表意味着接受其语言偏好和认知颗粒度,这在多模态领域尤为致命。字节跳动的Seed系列模型专注于原生多模态能力,如Seedance 2.0已实现原生音画同步的视频生成,支持60秒2K分辨率视频和8种语言唇形对齐。这种能力的前提是模型在底层就实现文本、视频帧、音频信号的原子级映射,而“蒸馏”技术会破坏这种自主性。

在硬件层面,字节跳动面临特殊挑战。受美国芯片出口管制限制,公司无法采购英伟达最新旗舰芯片,只能使用性能受限的H20芯片。这迫使字节跳动通过扩大集群规模、提高资源利用率和极致工程优化来弥补单卡性能差距。目前,字节跳动已在内蒙古乌兰察布、山西大同、河北怀来等地建设多个智算中心,形成数万张卡规模的分布式算力网络。2026年,公司AI基础设施资本开支超过2000亿元,导致净利润同比明显下滑。

张一鸣本人将一半精力投入到Seed团队,推动公司自主研发从底层算子优化到训练故障恢复的全栈工程体系。这种“重工业”级的技术积累,正是字节跳动拒绝“蒸馏”路线的底气所在。当模型参数规模持续攀升时,竞争门槛将从算法转向工程能力,只有掌握完整基建能力的玩家才能留在牌桌上。

据《金融时报》报道,字节跳动正在讨论训练一个参数规模达10万亿的大模型,远超国内其他领先模型的参数规模。这一项目由Seed Foundation负责人项亮主导,仍处于早期探索阶段。如果成功,这将是国内参数规模最大的模型计划。选择如此激进的路线,字节跳动旨在通过规模跃迁直接进入下一技术梯队,同时规避潜在的知识产权和合规风险。

在全球化布局和长期技术竞争中,全链路自研模型的优势愈发明显。当DeepSeek被OpenAI指控“蒸馏”,美国立法将模型数据窃取纳入国家安全范畴时,字节跳动的选择展现了其战略远见。张一鸣在内部会议上明确表示,希望Seed模型能力能跻身世界第一梯队,而技术主权和定义智能上限的机会,正是这条艰难道路的最终回报。

 
 
更多>同类内容
全站最新
热门内容
本栏最新