kimi o1和deepseek o1对比,非常直观!
Reinforcement Learning for all Scenarios,二次强化学习阶段,旨在提高模型的有用性和无害性,同时优化其推理能力,对于推理数据,用基于规则的奖励来指导数学、代码和逻辑推理领域的学习过程。deepseek 方案最重要的步骤是 DeepSeek-R1-Zero,用了一个 cot 的 prompt 模板,然后一堆基于规则的 reward 模型,强化学习用的 GRPO,
两家凑巧同一天放出了解题推理模型,简单对比着看了下实现方案,o1 类模型实现并没有和大家早期推测的那样用上 MCTS,PRM 这些方法,个人感觉也是太复杂的方法 scaling 不了。
目前各家用的方案看起来更像是 sft+rl 的加强版,把推理过程内含进生成,而不是用结构去引导生成。两家效果看报告比较接近,个有所长。
code 和 math deepseek 强了一点点,kimi 支持 vision。base 的 rl 基于 token, o1 的 rl 基于思考过程的 node,更符合直觉。
总体上,kimi 的方案是 pretraining,vanilla supervised fine-tuning (SFT),long-CoT supervised fine-turning,and reinforcement learning (RL)。
kimi 的方案可能更接近 openai o1,先用高质量的 Cot 数据 finetune一个推理模型,然后用一堆 rm 进行大规模的强化学习,路子比较传统一些。讲的比较清楚。
deepseek 的方案是 pretrainning,Cold start SFT,DeepSeek-R1-Zero,Rejection Sampling and SFT,RL2 for all Scenarios。
deepseek 方案最重要的步骤是 DeepSeek-R1-Zero,用了一个 cot 的 prompt 模板,然后一堆基于规则的 reward 模型,强化学习用的 GRPO,方法比较直接。
但是 deepseek 的方案从 base model 直接训练推理能力,实在太强了,有种大力出奇迹的美。
总体来说,deepseek 方案创新度更高,kimi 方案可能更接近 openai 的路子。
01
kimi 方案的一些细节
vanilla SFT
非推理任务,包括问答、写作和文本处理,先人工标注构建一个种子数据集,训练一个种子模型。
随后收集多样化提示,用种子模型为每个提示生成多个回复。标注者对这些回复进行排序,对排名最高的回复进行优化,以生成最终版本。
对于数学和编程问题等推理任务,基于规则和奖励模型的验证比人工判断更准确和高效,利用拒绝采样来扩展 SFT 数据集。
Long-CoT Supervised Fine-Tuning
这一步应该是让模型具有长思维链能力,方便后续 RL 学习。
首先要构建一套 RL Prompt,满足 3 个要求 Diverse Coverage(多样性)、Balanced Difficulty(难度均衡)、Accurate Evaluability(方便评估),然后构建了一个小而高质量的长链思维(long-CoT)预热数据集,其中包含针对文本和图像输入的经过准确验证的推理路径。
这种方法类似于拒绝采样(RS),但侧重于通过提示工程生成长链思维推理路径。
生成的预热数据集旨在封装对人类推理至关重要的关键认知过程,例如规划,即模型在执行前系统地列出步骤;评估,涉及对中间步骤的批判性评估;反思,使模型能够重新考虑并优化其方法;以及探索,鼓励考虑替代解决方案。
通过对该预热数据集进行轻量级的监督微调(SFT),经过微调后模型生成的回复更详细且逻辑一致更好。
ps:RL Prompt 具体什么样子,怎么指导 Long Cot 不太清楚。
RL
这部分篇幅很多,讲了推理问题的路径搜索和策略优化算法,但是看最后的 gradient 公式,就是正常的 policy gradient,很多东西都内含进生成里面了,比如策略 z。

02
Deepseek 方案的一些细节
冷启动,针对 DeepSeek-R1-Zero 的可读性差,格式差,不符合人类偏好的问题,做了几千条冷启动数据 finetune。
Reasoning-oriented Reinforcement Learning,这个阶段类似 DeepSeek-R1-Zero 阶段,同时为了为了缓解语言混合问题,强化学习训练中引入了语言一致性奖励,score 为目标语言词汇在思维链中所占的比例。
Rejection Sampling and Supervised Fine-Tuning,利用推理数据和非推理数据一起进行 SFT,以增强模型在写作、角色扮演和其他通用任务中的能力。
Reinforcement Learning for all Scenarios,二次强化学习阶段,旨在提高模型的有用性和无害性,同时优化其推理能力,对于推理数据,用基于规则的奖励来指导数学、代码和逻辑推理领域的学习过程。
对于通用数据,采用奖励模型来捕捉复杂和微妙场景中的人类偏好。
03
总结
deepseek 方案看起来更简洁,创新程度更高,但是对工程能力要求更高,看起来简单实现起来就不是那么回事了。
kimi 的方案可能更接近 openai o1,论文写的比较详细,抄作业的难度会更低一点。
目前推理模型的核心还是高质量的 cot 推理数据加上上规模的强化学习。相信后面还会有很多接近 o1 效果的模型出现。
这份《AI产品经理学习资料包》已经上传CSDN,还有完整版的大模型 AI 学习资料,朋友们如果需要可以在文末CSDN官方认证二维码免费领取【保证100%免费】
资料包: CSDN大礼包:《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享

AI产品经理,0基础小白入门指南
作为一个零基础小白,如何做到真正的入局AI产品?
什么才叫真正的入局?
是否懂 AI、是否懂产品经理,是否具备利用大模型去开发应用能力,是否能够对大模型进行调优,将会是决定自己职业前景的重要参数。
你是否遇到这些问题:
1、传统产品经理
不懂Al无法对AI产品做出判断,和技术沟通丧失话语权
不了解 AI产品经理的工作流程、重点
2、互联网业务负责人/运营
对AI焦虑,又不知道怎么落地到业务中想做定制化AI产品并落地创收缺乏实战指导
3、大学生/小白
就业难,不懂技术不知如何从事AI产品经理想要进入AI赛道,缺乏职业发展规划,感觉遥不可及
为了帮助开发者打破壁垒,快速了解AI产品经理核心技术原理,学习相关AI产品经理,及大模型技术。从原理出发真正入局AI产品经理。
这里整理了一些AI产品经理学习资料包给大家
📖AI产品经理经典面试八股文
📖大模型RAG经验面试题
📖大模型LLMS面试宝典
📖大模型典型示范应用案例集99个
📖AI产品经理入门书籍
📖生成式AI商业落地白皮书
🔥作为AI产品经理,不仅要懂行业发展方向,也要懂AI技术,可以帮助大家:
✅深入了解大语言模型商业应用,快速掌握AI产品技能
✅掌握AI算法原理与未来趋势,提升多模态AI领域工作能力
✅实战案例与技巧分享,避免产品开发弯路
这份《AI产品经理学习资料包》已经上传CSDN,还有完整版的大模型 AI 学习资料,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
资料包: CSDN大礼包:《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享
AI大模型学习福利
作为一名热心肠的互联网老兵,我决定把宝贵的AI知识分享给大家。 至于能学习到多少就看你的学习毅力和能力了 。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
大模型&AI产品经理如何学习
求大家的点赞和收藏,我花2万买的大模型学习资料免费共享给你们,来看看有哪些东西。
1.学习路线图

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;
第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;
第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;
第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;
第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;
第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;
第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。
2.视频教程
网上虽然也有很多的学习资源,但基本上都残缺不全的,这是我自己整理的大模型视频教程,上面路线图的每一个知识点,我都有配套的视频讲解。


(都打包成一块的了,不能一一展开,总共300多集)
因篇幅有限,仅展示部分资料,需要点击CSDN大礼包:《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享前往获取
3.技术文档和电子书
这里主要整理了大模型相关PDF书籍、行业报告、文档,有几百本,都是目前行业最新的。

4.LLM面试题和面经合集
这里主要整理了行业目前最新的大模型面试题和各种大厂offer面经合集。

👉学会后的收获:👈
• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;
• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;
• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;
• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集
👉获取方式:
😝有需要的小伙伴,可以CSDN大礼包:《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享免费领取【保证100%免费】🆓
火山引擎开发者社区是火山引擎打造的AI技术生态平台,聚焦Agent与大模型开发,提供豆包系列模型(图像/视频/视觉)、智能分析与会话工具,并配套评测集、动手实验室及行业案例库。社区通过技术沙龙、挑战赛等活动促进开发者成长,新用户可领50万Tokens权益,助力构建智能应用。
更多推荐
所有评论(0)