快手一面快手二面
快手一面
📍面试公司:快手
💻面试岗位:大模型
❓面试问题:
1. 自我介绍
2. 直接拷打实习不需要介绍
3. 选择基座模型的理由
4. ppo的奖励函数是怎么自定义的
5. star法则两句话介绍清楚论文
🙌面试感想:
快问快答几乎没有八股,有点小压力
好的,这是一份对您提供的“快手大模型一面”面经的全面分析和解答。这场面试非常典型,专注于项目深度和技术细节,而不是泛泛而谈的八股文。
面试风格分析
正如您所感想的,这是一场典型的“项目深度拷问”式面试。面试官不关心你“知道什么”,而关心你“做过什么”以及“为什么这么做”。他期望你对自己项目中的每一个技术选型、每一个实现细节都有清晰的理解和充分的理由。这种面试压力大,但能非常有效地筛选出有真才实学和动手能力的候选人。
下面我将对提到的每个问题逐一进行拆解,分析面试官的考察点,并提供回答思路。
问题分析与回答思路
1. 自我介绍
-
考察点:精炼总结和引导能力。面试官希望用最短的时间了解你的技术背景和最相关的项目经历,以便后续深入提问。他不想听冗长的个人生平。
-
回答思路:
-
模板:“我是[姓名],来自[学校][专业],目前主要研究方向是[NLP/大模型]。”
-
核心:用一句话概括你的核心优势,例如:“我尤其在大语言模型的SFT(监督微调) 和RLHF(人类反馈的强化学习) 方面有深入的实践和项目经验。”
-
引导:直接抛出你希望被问的锚点:“在[某公司]的实习期间,我独立负责了一个基于LLaMA的对话模型从SFT到PPO训练的全流程,并成功将人工评估胜率提升了XX%。”
-
目的:迅速将话题引向你最熟悉的、准备最充分的项目上,掌握主动权。
-
2. 直接拷打实习(不需要介绍)
-
考察点:项目的真实性与深度。面试官默认你已经介绍过了(或者他简历看过了),他要跳过前戏,直接进入核心环节。问题会非常具体和尖锐。
-
可能追问的方向:
-
数据:“你的SFT数据和Reward模型数据是怎么构建的?规模多大?清洗和标注的流程是怎样的?遇到了什么数据质量问题?怎么解决的?”
-
实验设计:“为什么选择这个基座模型(回到问题3)?SFT阶段你尝试过哪些超参数(学习率、轮数)?不同的参数对效果有什么影响?你是怎么评估模型好坏的?”
-
工程实现:“你的训练框架是什么?DeepSpeed?FSDP?显存是如何优化的?LoRA/QLoRA用的是哪种配置?”
-
-
回答思路:诚实 + 细节 + 反思。不要吹嘘,详细描述你做了什么,为什么这么做,以及过程中的挑战和思考。例如:“我们最初尝试了全参数微调,但显存不足,后来改用LoRA,发现r=8时效果和训练速度达到了最佳平衡,r=16时出现了过拟合。”
3. 选择基座模型的理由
-
考察点:技术选型能力和行业洞察力。你是否能基于任务需求、资源限制和模型特性做出合理的决策。
-
回答思路:这是一个展示你思考全面性的好机会。可以从以下几个维度展开:
-
许可协议与商用性:“我们的项目需要考虑商业化可能性,因此首先排除了LLaMA-1/2(非商用许可),在可商用的模型中,我们考虑了
Falcon、MPT和ChatGLM2。最终选择ChatGLM2-6B是因为它对中文优化更好,且社区活跃,遇到的问题更容易找到解决方案。” -
模型能力与性能:“我们对比了不同模型在
C-Eval、MMLU等中英文基准上的表现,ChatGLM2在同等参数量下中文能力突出,且进行了多轮对话优化,符合我们的任务需求。” -
资源消耗与效率:“考虑到我们的计算资源(如8*A100),7B以下的模型是更现实的选择。
ChatGLM2-6B的推理和训练效率在同类模型中具有优势。” -
生态与工具链:“
ChatGLM2提供了完整的、文档清晰的推理和微调工具链,降低了我们的开发部署成本。”
-
4. PPO的奖励函数是怎么自定义的
-
考察点:对RLHF核心机制的理解和解决实际问题的能力。奖励函数是RLHF的灵魂,直接决定了模型优化的方向。
-
回答思路:
-
基础组成:首先说明奖励函数的通用组成部分:“我们的奖励函数
R(x, y) = R_θ(x, y) + β * KL(y, y_ref),其中R_θ是奖励模型打出的分数,KL散度是用于约束策略模型(Policy Model)不要偏离SFT后的参考模型(Reference Model)太远,β是调节系数。” -
自定义的关键:这是加分项。说明你如何根据具体任务调整这个函数。
-
针对“安全性”:“为了防止模型生成有害内容,我们在奖励中增加了一个基于规则的安全惩罚项
- γ * S(y),如果检测到敏感词,S(y)会返回一个很大的惩罚值。” -
针对“长度偏好”:“我们发现奖励模型有时会偏向长回复,因此我们尝试加入了长度归一化,比如
R_θ(x, y) / len(y),或者设置一个理想长度范围,超出范围的回复会受到惩罚。” -
针对“多样性”:“为了避免模型回复模式单一,我们加入了困惑度(PPL)惩罚 或 重复词惩罚,鼓励模型生成更丰富多样的文本。”
-
-
实验结论:“我们通过A/B测试发现,加入安全性惩罚后,人工评估中有害回复的比例下降了XX%。而长度归一化有效缓解了模型‘说废话’的问题。”
-
5. STAR法则两句话介绍清楚论文
-
考察点:沟通表达能力和项目概括能力。能否在极短时间内向不同背景的人(如未来的同事、产品经理)清晰地传递你工作的价值。
-
回答思路:
-
S (Situation) + T (Task):第一句话交代背景和任务。
-
“在S(多轮对话任务中),T(为了解决模型回答冗长且缺乏重点的问题),...”
-
-
A (Action) + R (Result):第二句话说明采取的关键行动和带来的量化结果。
-
“...我们A(设计了一种将回复重点信息提取与RM训练相结合的方法),R(最终在人工评估中將模型回复的准确率和简洁度分别提升了15%和30%)。”
-
-
总结与建议
-
深入复盘项目:把你实习/项目中的每一个细节都重新捋一遍,确保能经得住连环追问。为什么(Why)> 怎么做(How)> 是什么(What)。
-
准备“宝典”:为你的核心项目准备一个文档,写下所有可能被问到的点及其答案,包括:数据细节、模型选型理由、超参数设置、训练过程中的坑、评估指标和结果等。
-
练习表达:像第5题一样,强迫自己用最精炼的语言概括复杂的工作。这是非常宝贵的能力。
-
保持冷静:遇到压力面不要慌,这通常是好信号,说明面试官对你感兴趣。诚实回答,如果不知道就坦诚地说“这个方面我没有深入涉及”,并试着给出自己的思考,远比胡诌要好。
这场面试虽然让你感到有压力,但问题质量非常高,很好地反映了快手大模型团队对候选人工程实践与理论深度结合的要求。祝你在后续的面试中一切顺利!
快star大模型秋招一面凉经
岗位:大模型算法工程师
面试 timeline:7.24
面试时长:1h
面试问题:
1. 你最有成就感的是那个经历?(搞得我以为是hr面)
2. 这段经历的业务背景,具体讲了过程和解决手段
(基本没什么八股,算是纯聊天)
手撕算法:最短编辑距离 讲思路+实现
反问:业务方向,工作强度
面试感觉:整体无压力,就问了一个工作,其他的都没问,看着到时间了就说写题吧,题也很简单,感觉像kpi,果然寄了
感谢你分享这段面试经历。这是一份非常典型的大模型算法岗位一面“凉经”,信息量很足,能分析出很多有价值的内容。
以下是我对你的面试经历的分析和总结,以及一些未来的建议:
面试复盘分析
-
面试风格:这属于一种“行为面 + 算法基础”的组合。面试官没有问传统的八股文(如Transformer细节、优化器、激活函数等),而是更关注你的项目经验、解决问题的能力和动机。这在大厂的核心算法岗中越来越常见,他们想找的是能解决实际问题的工程师,而不是只会背书的学生。
-
“最有成就感的经历”:这个问题绝对不是HR面专属,而是技术面的核心问题之一。
-
面试官目的:考察你的技术热情、项目深度、解决复杂问题的能力、复盘总结能力和影响力。他们想通过一个你最熟悉的项目,深入了解你的技术实力。
-
如何回答:需要一个结构化的回答(STAR原则:Situation, Task, Action, Result)。重点突出:技术选型的思考(为什么用A模型而不是B)、遇到的挑战(数据、算力、模型效果等)、你的解决方案(体现了你的技术深度和创新)、带来的量化提升(指标提升了多少)、以及你的个人贡献。
-
-
手撕算法:最短编辑距离
-
题目本身:这是一道经典的动态规划题目,难度属于中等偏下。面试官出这道题,很可能只是想确认你的基础编码能力是否过关,算法思想是否清晰。
-
“感觉像KPI”:因为你感觉问题简单且整体流程快,所以产生了KPI面的怀疑。有两种可能:
-
可能性一(正面):面试官在前30分钟聊项目时,已经对你的能力有了初步判断。这道算法题只是走个必要流程,确认一下coding底线。
-
可能性二(负面):之前的项目经历没有充分展示出你的技术亮点,未能打动面试官,导致面试官决定快速走完流程。“凉”的原因可能不在于算法题,而在于项目深度挖掘得不够。
-
-
-
最终“凉”的可能原因
-
项目经历挖掘不足:这是最大的可能性。面试官希望你通过“最有成就感的经历”来展示你的技术实力,但如果你的阐述只停留在“做了什么”,而没有深入“为什么这么做”、“遇到了什么困难”、“如何解决的”、“有什么独到之处”,可能会让面试官觉得项目深度不够,或你的个人贡献不足。
-
与岗位匹配度:大模型算法工程师岗位可能更期望听到你在LLM预训练、SFT、RLHF、模型压缩、推理加速、智能体应用等方面的经验。如果你的项目是传统的CV/NLP项目,可能需要更好地建立与你申请岗位的联系。
-
算法题虽然AC,但表现不佳:比如代码不够整洁、边界条件处理不好、没有与面试官充分交流思路等。
-
给你的未来建议
-
深度复盘项目:为你最重要的1-2个项目准备一个详细的介绍稿,用STAR原则组织语言。确保你能清晰地回答:
-
项目的商业目标是什么?
-
你的具体任务是什么?
-
你做了哪些技术尝试和选型?(体现思考过程)
-
遇到的最大挑战是什么?你是如何解决的?(这是亮点)
-
最终结果如何?有哪些量化指标?
-
如果有后续,你会如何优化?
-
-
强化基础知识:虽然这次没问八股,但绝不能不会。务必熟练掌握:
-
LLM核心:Transformer架构(尤其是Self-Attention)、各种位置编码、LLM的训练流程(预训练、SFT、RLHF)、推理加速技术(如Flash Attention, Quantization)、主流大模型的特点(如LLaMA, GPT, Claude等)。
-
机器学习基础:优化算法(AdamW, SGD等)、正则化、损失函数等。
-
编程与算法:继续刷题,保持手感。动态规划、二叉树、链表、数组相关题目是重点。不仅要AC,还要代码优美、沟通流畅。
-
-
调整面试策略:
-
主动引导:在介绍项目时,可以主动说:“在这个项目中,我最想分享的技术亮点是我们在解决XX问题时采用的YY方法...”,从而将话题引导到你准备最充分、最自信的技术点上。
-
积极沟通:写算法时,一定要先讲思路,确认无误后再写代码。写完后主动解释代码逻辑和时空复杂度。
-
总结一下:
这次面试不一定是KPI面,更像是一次考察“项目深度和解题基础”的面试。失利的主要原因很可能是在“最有成就感的经历”这一环节,没有充分展示出你的技术实力和思考深度。
不要气馁,每一次面试都是宝贵的经验。认真根据上述建议准备,下一次一定能拿到更好的结果!祝你求职顺利!
最短编辑距离是力扣那一题
你提到的“最短编辑距离”对应的就是 LeetCode 第 72 题,题目名称为:
72. Edit Distance (编辑距离)
📌 题目链接
🧠 题目描述
给定两个单词 word1和 word2,计算将 word1转换成 word2所使用的最少操作次数。允许的操作包括:
-
插入一个字符
-
删除一个字符
-
替换一个字符
💡 核心思路 - 动态规划 (Dynamic Programming)
这是解决编辑距离问题的经典且最优方法。
-
定义状态: 创建一个二维数组
dp[i][j],表示将word1的前i个字符转换为word2的前j个字符所需的最少操作次数。 -
初始化:
-
dp[0][0] = 0:两个空字符串不需要操作。 -
dp[i][0] = i:将word1的前i个字符变成空字符串,需要删除i次。 -
dp[0][j] = j:将空字符串变成word2的前j个字符,需要插入j次。
-
-
状态转移方程:
-
如果
word1[i-1] == word2[j-1]:最后一个字符相同,不需要操作。-
dp[i][j] = dp[i-1][j-1]
-
-
如果
word1[i-1] != word2[j-1]:最后一个字符不同,需要执行插入、删除或替换中的一种操作,取这三种操作的最小值再加 1。-
dp[i][j] = 1 + min(-
dp[i][j-1], // 插入:在word1末尾插入一个和word2[j-1]相同的字符(相当于word2前进了) -
dp[i-1][j], // 删除:删除word1的最后一个字符(相当于word1前进了) -
dp[i-1][j-1]// 替换:将word1的最后一个字符替换成word2[j-1](相当于两个单词都前进了) -
)
-
-
-
-
最终结果:
dp[m][n]即为所求的编辑距离,其中m = len(word1),n = len(word2)。
⚠️ 面试注意点
-
清晰解释思路: 务必在白板/在线编辑器上清晰地画出
dp表,解释状态定义、初始化和状态转移方程的逻辑。 -
考虑边界条件: 重点解释初始化部分(空字符串的情况)。
-
代码实现:
-
注意二维数组的创建和索引(通常
dp[i][j]对应word1[0..i-1]和word2[0..j-1])。 -
正确比较字符
word1[i-1]和word2[j-1]。 -
熟练写出状态转移的
min比较。 -
注意代码格式和变量命名。
-
-
复杂度分析: 明确说出时间和空间复杂度都是
O(m * n)。 -
可能的Follow-up:
-
空间优化: 能否将空间复杂度优化到
O(min(m, n))? (可以,只保留当前行和上一行) -
实际输出操作序列: 如何回溯
dp表输出具体的插入、删除、替换操作序列? (需要记录操作来源) -
其他相似问题: 最长公共子序列(LCS)、最长递增子序列(LIS) 等动态规划问题的联系与区别。
-
📖 为什么是面试高频题?
-
经典DP问题: 完美考察动态规划思想的理解和应用能力。
-
广泛应用: NLP中的拼写纠错、生物信息学中的DNA序列比对等核心场景。
-
难度适中: 作为一面手撕题,既不会太简单(需要理解DP),也不会过于复杂(思路清晰、代码量适中)。
建议你在 LeetCode 上找到第 72 题“Edit Distance”,练习代码实现并理解每一步的推导过程,这是应对此类面试的必备技能。 祝你下次面试顺利!
更多推荐

所有评论(0)