kimi o1和deepseek o1对比，非常直观！

Reinforcement Learning for all Scenarios，二次强化学习阶段，旨在提高模型的有用性和无害性，同时优化其推理能力，对于推理数据，用基于规则的奖励来指导数学、代码和逻辑推理领域的学习过程。deepseek 方案最重要的步骤是 DeepSeek-R1-Zero，用了一个 cot 的 prompt 模板，然后一堆基于规则的 reward 模型，强化学习用的 GRPO，

Java程序员周瑜

1207人浏览 · 2025-05-09 14:04:03

Java程序员周瑜 · 2025-05-09 14:04:03 发布

两家凑巧同一天放出了解题推理模型，简单对比着看了下实现方案，o1 类模型实现并没有和大家早期推测的那样用上 MCTS，PRM 这些方法，个人感觉也是太复杂的方法 scaling 不了。

目前各家用的方案看起来更像是 sft+rl 的加强版，把推理过程内含进生成，而不是用结构去引导生成。两家效果看报告比较接近，个有所长。

code 和 math deepseek 强了一点点，kimi 支持 vision。base 的 rl 基于 token， o1 的 rl 基于思考过程的 node，更符合直觉。

总体上，kimi 的方案是 pretraining，vanilla supervised fine-tuning (SFT)，long-CoT supervised fine-turning，and reinforcement learning (RL)。

kimi 的方案可能更接近 openai o1，先用高质量的 Cot 数据 finetune一个推理模型，然后用一堆 rm 进行大规模的强化学习，路子比较传统一些。讲的比较清楚。

deepseek 的方案是 pretrainning，Cold start SFT，DeepSeek-R1-Zero，Rejection Sampling and SFT，RL2 for all Scenarios。

deepseek 方案最重要的步骤是 DeepSeek-R1-Zero，用了一个 cot 的 prompt 模板，然后一堆基于规则的 reward 模型，强化学习用的 GRPO，方法比较直接。

但是 deepseek 的方案从 base model 直接训练推理能力，实在太强了，有种大力出奇迹的美。

总体来说，deepseek 方案创新度更高，kimi 方案可能更接近 openai 的路子。

kimi 方案的一些细节

vanilla SFT

非推理任务，包括问答、写作和文本处理，先人工标注构建一个种子数据集，训练一个种子模型。

随后收集多样化提示，用种子模型为每个提示生成多个回复。标注者对这些回复进行排序，对排名最高的回复进行优化，以生成最终版本。

对于数学和编程问题等推理任务，基于规则和奖励模型的验证比人工判断更准确和高效，利用拒绝采样来扩展 SFT 数据集。

Long-CoT Supervised Fine-Tuning

这一步应该是让模型具有长思维链能力，方便后续 RL 学习。

首先要构建一套 RL Prompt，满足 3 个要求 Diverse Coverage(多样性)、Balanced Difficulty(难度均衡)、Accurate Evaluability(方便评估)，然后构建了一个小而高质量的长链思维（long-CoT）预热数据集，其中包含针对文本和图像输入的经过准确验证的推理路径。

这种方法类似于拒绝采样（RS），但侧重于通过提示工程生成长链思维推理路径。

生成的预热数据集旨在封装对人类推理至关重要的关键认知过程，例如规划，即模型在执行前系统地列出步骤；评估，涉及对中间步骤的批判性评估；反思，使模型能够重新考虑并优化其方法；以及探索，鼓励考虑替代解决方案。

通过对该预热数据集进行轻量级的监督微调（SFT），经过微调后模型生成的回复更详细且逻辑一致更好。

ps：RL Prompt 具体什么样子，怎么指导 Long Cot 不太清楚。

这部分篇幅很多，讲了推理问题的路径搜索和策略优化算法，但是看最后的 gradient 公式，就是正常的 policy gradient，很多东西都内含进生成里面了，比如策略 z。

Deepseek 方案的一些细节

冷启动，针对 DeepSeek-R1-Zero 的可读性差，格式差，不符合人类偏好的问题，做了几千条冷启动数据 finetune。

Reasoning-oriented Reinforcement Learning，这个阶段类似 DeepSeek-R1-Zero 阶段，同时为了为了缓解语言混合问题，强化学习训练中引入了语言一致性奖励，score 为目标语言词汇在思维链中所占的比例。

Rejection Sampling and Supervised Fine-Tuning，利用推理数据和非推理数据一起进行 SFT，以增强模型在写作、角色扮演和其他通用任务中的能力。

Reinforcement Learning for all Scenarios，二次强化学习阶段，旨在提高模型的有用性和无害性，同时优化其推理能力，对于推理数据，用基于规则的奖励来指导数学、代码和逻辑推理领域的学习过程。

对于通用数据，采用奖励模型来捕捉复杂和微妙场景中的人类偏好。

总结

deepseek 方案看起来更简洁，创新程度更高，但是对工程能力要求更高，看起来简单实现起来就不是那么回事了。

kimi 的方案可能更接近 openai o1，论文写的比较详细，抄作业的难度会更低一点。

目前推理模型的核心还是高质量的 cot 推理数据加上上规模的强化学习。相信后面还会有很多接近 o1 效果的模型出现。

这份《AI产品经理学习资料包》已经上传CSDN，还有完整版的大模型 AI 学习资料，朋友们如果需要可以在文末CSDN官方认证二维码免费领取【保证100%免费】
资料包： CSDN大礼包：《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享

AI产品经理，0基础小白入门指南
作为一个零基础小白，如何做到真正的入局AI产品？

什么才叫真正的入局？

是否懂 AI、是否懂产品经理，是否具备利用大模型去开发应用能力，是否能够对大模型进行调优，将会是决定自己职业前景的重要参数。

你是否遇到这些问题：
1、传统产品经理

不懂Al无法对AI产品做出判断，和技术沟通丧失话语权
不了解 AI产品经理的工作流程、重点
2、互联网业务负责人/运营
对AI焦虑，又不知道怎么落地到业务中想做定制化AI产品并落地创收缺乏实战指导
3、大学生/小白
就业难，不懂技术不知如何从事AI产品经理想要进入AI赛道，缺乏职业发展规划，感觉遥不可及
为了帮助开发者打破壁垒，快速了解AI产品经理核心技术原理，学习相关AI产品经理，及大模型技术。从原理出发真正入局AI产品经理。

这里整理了一些AI产品经理学习资料包给大家
📖AI产品经理经典面试八股文
📖大模型RAG经验面试题
📖大模型LLMS面试宝典
📖大模型典型示范应用案例集99个
📖AI产品经理入门书籍
📖生成式AI商业落地白皮书

🔥作为AI产品经理，不仅要懂行业发展方向，也要懂AI技术，可以帮助大家：
✅深入了解大语言模型商业应用，快速掌握AI产品技能
✅掌握AI算法原理与未来趋势，提升多模态AI领域工作能力
✅实战案例与技巧分享，避免产品开发弯路

这份《AI产品经理学习资料包》已经上传CSDN，还有完整版的大模型 AI 学习资料，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
资料包： CSDN大礼包：《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享

AI大模型学习福利
作为一名热心肠的互联网老兵，我决定把宝贵的AI知识分享给大家。至于能学习到多少就看你的学习毅力和能力了。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

大模型&AI产品经理如何学习
求大家的点赞和收藏，我花2万买的大模型学习资料免费共享给你们，来看看有哪些东西。

1.学习路线图

第一阶段：从大模型系统设计入手，讲解大模型的主要方法；

第二阶段：在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用；

第三阶段：大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统；

第四阶段：大模型知识库应用开发以LangChain框架为例，构建物流行业咨询智能问答系统；

第五阶段：大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型；

第六阶段：以SD多模态大模型为主，搭建了文生图小程序案例；

第七阶段：以大模型平台应用与开发为主，通过星火大模型，文心大模型等成熟大模型构建大模型行业应用。

2.视频教程
网上虽然也有很多的学习资源，但基本上都残缺不全的，这是我自己整理的大模型视频教程，上面路线图的每一个知识点，我都有配套的视频讲解。

（都打包成一块的了，不能一一展开，总共300多集）

因篇幅有限，仅展示部分资料，需要点击CSDN大礼包：《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享前往获取

3.技术文档和电子书
这里主要整理了大模型相关PDF书籍、行业报告、文档，有几百本，都是目前行业最新的。

4.LLM面试题和面经合集
这里主要整理了行业目前最新的大模型面试题和各种大厂offer面经合集。

👉学会后的收获：👈
• 基于大模型全栈工程实现（前端、后端、产品经理、设计、数据分析等），通过这门课可获得不同能力；

• 能够利用大模型解决相关实际项目需求：大数据时代，越来越多的企业和机构需要处理海量数据，利用大模型技术可以更好地处理这些数据，提高数据分析和决策的准确性。因此，掌握大模型应用开发技能，可以让程序员更好地应对实际项目需求；

• 基于大模型和企业数据AI应用开发，实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能，学会Fine-tuning垂直训练大模型（数据准备、数据蒸馏、大模型部署）一站式掌握；

• 能够完成时下热门大模型垂直领域模型训练能力，提高程序员的编码能力：大模型应用开发需要掌握机器学习算法、深度学习框架等技术，这些技术的掌握可以提高程序员的编码能力和分析能力，让程序员更加熟练地编写高质量的代码。

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集

👉获取方式：
😝有需要的小伙伴，可以CSDN大礼包：《对标阿里黑客&网络安全入门&进阶学习资源包》免费分享免费领取【保证100%免费】🆓

火山引擎 ADG 社区

火山引擎开发者社区是火山引擎打造的AI技术生态平台，聚焦Agent与大模型开发，提供豆包系列模型（图像/视频/视觉）、智能分析与会话工具，并配套评测集、动手实验室及行业案例库。社区通过技术沙龙、挑战赛等活动促进开发者成长，新用户可领50万Tokens权益，助力构建智能应用。

更多推荐

Chess用户界面设计：Tailwind CSS样式系统和组件库

GitHub推荐项目精选中的ch/chess是一个类似chess.com的多人在线象棋平台，它采用现代化的前端技术栈构建，尤其在用户界面设计上通过Tailwind CSS样式系统和组件库实现了优雅且功能丰富的交互体验。本文将深入探讨该项目如何利用Tailwind CSS打造一致的设计语言和高效的组件系统，为象棋爱好者提供沉浸式的游戏界面。## 🎨 Tailwind CSS样式系统：构建统一视

火山引擎 ADG 社区

终极指南：GPT-Engineer如何通过AI自动发现代码问题并提升质量

GPT-Engineer是一款强大的AI驱动代码工具，它能帮助开发者自动检测潜在代码问题、优化代码质量，让编程效率提升3倍以上。无论是新手还是资深开发者，都能通过这款工具轻松发现代码中的隐藏缺陷，减少调试时间，释放更多精力在创造性工作上。## 一键发现代码问题：GPT-Engineer的AI审查魔力GPT-Engineer的核心能力在于其内置的智能代码分析系统。通过集成Python代码格式

火山引擎 ADG 社区

SatDump中的纠错编码技术：从RS码到Turbo码的完整实现指南

在卫星数据传输过程中，信号往往会受到各种干扰，导致数据错误。SatDump作为一款通用卫星数据处理软件，集成了多种先进的纠错编码技术，确保从卫星接收到的数据能够准确解码。本文将深入解析SatDump中从Reed-Solomon（RS）码到Turbo码的实现细节，帮助读者理解这些技术如何保障卫星通信的可靠性。## 为什么纠错编码对卫星数据至关重要？卫星与地面站之间的通信链路面临着空间辐射、大