Jeff Dean访谈:基础模型扩张下,小团队如何抓住AI创业新机遇?

   发布时间:2026-08-04 03:37 作者:顾雨柔

在人工智能技术飞速发展的当下,基础模型的能力边界不断拓展,科技巨头凭借资源优势占据主导地位,两三人组成的创业团队是否还有突围空间?谷歌首席科学家 Jeff Dean 在 Y Combinator 举办的 Startup School 活动中给出了明确答案:机会依然存在,但创业者需聚焦模型几乎无法完成的领域。

Jeff Dean 是计算机系统与人工智能领域的标志性人物。自 1999 年加入谷歌以来,他与长期合作者 Sanjay Ghemawat 共同设计了 MapReduce、Bigtable 等基础系统,为谷歌处理海量数据奠定技术基石。进入深度学习时代后,他又主导了 TensorFlow、TPU 等关键项目,并参与创立 Google Brain。如今,他负责统筹 Google DeepMind 与 Google Research 的 AI 研究方向,其观点对行业具有重要参考价值。

当前,AI 行业正从模型训练转向大规模应用,推理环节成为新的瓶颈。用户每次提问或 Agent 执行任务时,模型都需进行推理,而长时间运行的复杂任务会放大推理延迟与成本。Jeff Dean 指出,AI 计算中数据搬运的能耗远高于计算本身,例如现代芯片完成一次乘法运算仅需约 1 皮焦耳能量,但数据从内存到处理器的搬运能耗可能是计算的 1000 倍。为平衡响应速度与硬件效率,行业需开发专用推理硬件,而非单纯依赖批处理优化。

谷歌的 TPU 设计便体现了这种平衡。2013 年,谷歌语音识别系统因深度学习升级面临推理成本激增问题,若继续使用 CPU,服务器规模需扩大一倍。为此,谷歌开发了通用线性代数计算系统 TPU,既支持快速迭代的机器学习算法,又避免了硬件与模型架构的强绑定。第一代 TPU 诞生时,Transformer 尚未出现,但它仍能适配后续模型发展。Jeff Dean 认为,未来将出现更多针对推理优化的硬件,以降低 Agent 长时间运行的延迟与能耗。

Agent 的能力进化是另一关键趋势。Jeff Dean 观察到,Agent 执行复杂任务的进度超出预期,部分领域已能连续运行数天甚至数周。然而,长期任务中模型易偏离目标,原因在于任务分布逐渐超出训练范围,早期错误会累积放大。解决这一问题需构建模型周边机制,例如提供技能指南、使用多 Agent 系统评估方案,或将人类经验转化为上下文工程。他举例称,自己与 Sanjay Ghemawat 将代码优化流程编写为 Agent 技能,使模型能自主运行基准测试、修改代码并评估性能。

对于创业团队,Jeff Dean 提出“1% 法则”:聚焦通用模型成功率接近零的任务,而非其已初步掌握的领域。他解释道,大公司虽能构建通用模型,但难以覆盖所有细分场景。创业者可通过三种方式建立优势:一是利用模型无法获取的私有数据,例如开发个人信息整理工具;二是训练专用模型,如 AlphaFold 针对蛋白质结构预测的垂直领域;三是结合专业工具与产品设计,将 1% 的成功率转化为实际产品。他强调,创业者需判断模型当前不足是因数据缺失还是架构限制,避免被快速迭代的通用能力淘汰。

当 Agent 承担更多执行任务时,人类的核心能力将转向问题定义与价值判断。Jeff Dean 认为,清晰的任务描述与验收标准是 Agent 高效执行的前提,而选择关键问题的“品味”则决定影响力上限。他以知识蒸馏技术为例:2014 年相关论文曾被评审认为“影响有限”,但谷歌因部署成本需求坚持研究,最终该技术成为行业标配。他建议创业者通过复盘判断积累经验,并组建技能互补的团队,使成员各自携带独特工具,共同解决复杂问题。

 
 
更多>同类内容
全站最新
热门内容
本栏最新