为什么最近几个月,全世界都觉得 AI 突然“疯了”一样在进化?从编码代理到自动化科研,AI 似乎一夜之间从“聊天机器人”变成了“数字员工”。
OpenAI 后训练前沿团队(Post-training Frontiers)负责人 Jan Leike 在最新访谈中给出了一个冷静的答案:AI 的基础能力一直在平滑增长,真正发生突变的是“可靠性”。 当出错率降到某个临界点之下,AI 就正式从实验室的“玩具”跨越成了现实世界的“工具”。

可靠性:AI 产品的“最后一公里”
Jan Leike 认为,用户感受到的“阶跃函数”般的进步,其实源于可靠性门槛的跨越。
“你需要达到一定的可靠性水平,人工智能才能真正有用。”Jan 透露,OpenAI 在去年 12 月左右才真正跨越了这道门槛。在此之前,AI 就像一个偶尔天才、偶尔胡言乱语的学徒;而现在,我们可以信任模型去完成大部分工作流。
这种可靠性的提升,标志着 AI 竞争的重心已经从“刷榜单”转向了“实用性”。正如 Jan 所说:“产品是最后一公里,而在垂直领域,这最后的分米级距离,正是未来巨大的发展空间。”
AI 辅助 AI:进化的正向循环
AI 进步加速的另一个秘密在于“自我加速”。
目前,OpenAI 内部的研究人员正深度依赖 AI 来编写代码、构建实验工具和优化模型训练。这种“AI 辅助 AI”的模式,让模型的迭代周期从以“月”为单位,缩短到了以“天”为单位。
这种正向循环意味着,模型越强,构建下一代模型的工具就越好,进化的齿轮正在越转越快。
RL 的降维打击:从数学竞赛到混乱现实
GPT-5.5 强大的根源,在于强化学习(RL)应用场景的彻底改变。
早期的推理模型(如 o1、o3)主要针对“可验证奖励”进行优化——比如数学题或编程竞赛,对错分明,信号清晰。但 Jan 团队的突破在于,他们成功将这些 RL 工具应用到了“混乱的现实世界工作流”中。
在没有标准答案、充满模糊性的现实任务里,GPT-5.5 展现出了极强的自适应能力。这不再是简单的“背题库”,而是模型学会了在复杂环境中通过逻辑思考找到最优解。
“一人公司”时代的蓝海
对于创业者,Jan 提出了一个极具启发性的观点:不要试图在通用智能上与巨头竞争,去深耕垂直领域的“最后分米”。
随着 AI 处理了 80% 的通用逻辑,剩下的 20% 行业特定权限、数据连接器和业务逻辑,将成为初创公司的护城河。在 AGI 真正到来之前,这种“最后分米”的价值将持续爆发。