
在几个月前面生成式推荐之外,主包还面了大模型算法岗日常实习,收获了一些offer。可惜人只能同时拿一个offer,狗头。
preliminary:llm算法也分很多,这里不说ai infra,agent 开发,也说的不是llm 剪枝、推理加速、数据合成。今天这里的指南主要是指llm或者mllm后训练的算法如何入门。
method:
首先,需要深入理解llm到底是怎么工作的。在主包看来,llm就是一个超大的超多层的transformer decoder。所以需要对attention有深入的理解,attention中每一个小module都有很多值得讨论的,比如提到归一化,你应该想到ln和bn的区别,rms norm是怎么实现的,应该pre norm还是post norm。再比如提到位置编码,你应该想到,postion embedding,alibi,rope的区别,以及由此引申的,多模态中rope怎么改进,长上下文中rope怎么改进的。这样的小组件的改进,还有优化器话题的,激活函数话题的,以及mha话题的,包括最近很火的线性attention。
然后在这个transformer的基础上,继续学习tokenization的工作原理,lora的原理,rag。mllm中还涉及如何对齐模态等等。在这里做一做用llm infer的脚本,熟悉llm生成文本的pipeline和不同search时的超参。
最后是后训练的内容,数据飞轮,sft,dpo,ppo,grpo,dapo。可以通过复现dsk的aha moment,继续体会grpo的一些问题。比如reward函数都有哪些设计方法,为什么会出现grpo的熵坍缩,grpo比ppo好在哪里,grpo的clip机制是要干啥,rl中重要性采样的作用以及由此引申的on policy/online的思考。
#互联网大厂实习 #大模型 #转码 #算法岗
写在后面的话:1. 最近更新的这些问题都来自粉丝的提问,主包这几天晚上坐地铁的二十分钟又有事情可干了。
2. 虽然大模型算法岗在秋招的时候很卷,也不一定要all in这个方向投。但是大模型的后训练算法对于每一个算法工程师的重要性无需多言。我们可以不做纯大模型的算法工程师,但必须了解ai最前沿的技术发展。主包的一些幼稚看法,欢迎批评指正和交流。
preliminary:llm算法也分很多,这里不说ai infra,agent 开发,也说的不是llm 剪枝、推理加速、数据合成。今天这里的指南主要是指llm或者mllm后训练的算法如何入门。
method:
首先,需要深入理解llm到底是怎么工作的。在主包看来,llm就是一个超大的超多层的transformer decoder。所以需要对attention有深入的理解,attention中每一个小module都有很多值得讨论的,比如提到归一化,你应该想到ln和bn的区别,rms norm是怎么实现的,应该pre norm还是post norm。再比如提到位置编码,你应该想到,postion embedding,alibi,rope的区别,以及由此引申的,多模态中rope怎么改进,长上下文中rope怎么改进的。这样的小组件的改进,还有优化器话题的,激活函数话题的,以及mha话题的,包括最近很火的线性attention。
然后在这个transformer的基础上,继续学习tokenization的工作原理,lora的原理,rag。mllm中还涉及如何对齐模态等等。在这里做一做用llm infer的脚本,熟悉llm生成文本的pipeline和不同search时的超参。
最后是后训练的内容,数据飞轮,sft,dpo,ppo,grpo,dapo。可以通过复现dsk的aha moment,继续体会grpo的一些问题。比如reward函数都有哪些设计方法,为什么会出现grpo的熵坍缩,grpo比ppo好在哪里,grpo的clip机制是要干啥,rl中重要性采样的作用以及由此引申的on policy/online的思考。
#互联网大厂实习 #大模型 #转码 #算法岗
写在后面的话:1. 最近更新的这些问题都来自粉丝的提问,主包这几天晚上坐地铁的二十分钟又有事情可干了。
2. 虽然大模型算法岗在秋招的时候很卷,也不一定要all in这个方向投。但是大模型的后训练算法对于每一个算法工程师的重要性无需多言。我们可以不做纯大模型的算法工程师,但必须了解ai最前沿的技术发展。主包的一些幼稚看法,欢迎批评指正和交流。


