




==== 欢迎一起探讨 全文请看图 ?===
Pre-training 终结了吗?Agent 还有前途吗?
关于这两个问题我有以下观点:
1. 预训练不仅没有结束,反而正在迎来新阶段。Ilya提到的\"撞墙\"确实与预训练数据耗尽有关,但我们还有合成数据这一选择,而且不仅限于从大模型中重写的数据。R1风格的方法可以利用可验证reward生成大量合成数据,我相信这将为Web-scale数据带来全新的信息增量,使基础模型能力在今年内有一次类似GPT-3.5到GPT-4级别的飞跃。这批新数据必然比原来更长,这也为模型架构创新提供了空间,linear/mixed attention可能是一个有前景的解决方案。
2. 现在所有基于 workflow 的 agents 都会被基模的成长吃掉,价值的窗口很短。这些脚手架本质上是在教LLM如何完成任务,类似十年前我们在深度学习中加入attention的做法,是一种人为归纳偏置,终将面临\"苦涩教训\"(The bitter lesson)。我唯一比较看好的是 RL-based Agents,即 DeepResearch 这样的东西,这是一种既定路线的扩展,但如我前面所说,还是需要有好的 infra + simulation + reward 协同发展,应该会是一个逐渐扩散的过程。
#大模型 #博士生日常 #chatgpt #deepseek #多模态
Pre-training 终结了吗?Agent 还有前途吗?
关于这两个问题我有以下观点:
1. 预训练不仅没有结束,反而正在迎来新阶段。Ilya提到的\"撞墙\"确实与预训练数据耗尽有关,但我们还有合成数据这一选择,而且不仅限于从大模型中重写的数据。R1风格的方法可以利用可验证reward生成大量合成数据,我相信这将为Web-scale数据带来全新的信息增量,使基础模型能力在今年内有一次类似GPT-3.5到GPT-4级别的飞跃。这批新数据必然比原来更长,这也为模型架构创新提供了空间,linear/mixed attention可能是一个有前景的解决方案。
2. 现在所有基于 workflow 的 agents 都会被基模的成长吃掉,价值的窗口很短。这些脚手架本质上是在教LLM如何完成任务,类似十年前我们在深度学习中加入attention的做法,是一种人为归纳偏置,终将面临\"苦涩教训\"(The bitter lesson)。我唯一比较看好的是 RL-based Agents,即 DeepResearch 这样的东西,这是一种既定路线的扩展,但如我前面所说,还是需要有好的 infra + simulation + reward 协同发展,应该会是一个逐渐扩散的过程。
#大模型 #博士生日常 #chatgpt #deepseek #多模态


