问题不可避免,但问题可以解决
这不是鸡汤,而是一种研发节奏:强化学习解决一批问题,会展开评估、验证、泛化等新问题。AI 公司真正的日常,是把新问题变成下一段山路。
这期约 100 分钟的访谈把 Kimi 创始人杨植麟过去一年的技术判断压缩成一条主线:AI 的进步不是抵达某个静态终点,而是在“问题不可避免、问题可以解决”的循环里,用更强的推理、Agent、创新与组织能力继续爬一座没有尽头的雪山。
先把整期最重要的技术与组织判断压成可复述的几句话。
1. AI 不是登月,而是一座可能没有尽头的雪山。 杨植麟反复借《The Beginning of Infinity》的框架解释研发状态:每解决一个问题,知识边界就扩大,同时制造新问题。AGI 更像方向而不是台阶,最重要的是持续爬升。
2. 过去一年的范式变化是 test-time scaling。 一条路线是强推理模型在脑内反复提出猜想并自我验证;另一条路线是 Agent 在多轮交互中使用工具、接收外界反馈。前者像“缸中之脑”,后者让模型把大脑接到世界。
3. K2 的核心叙事是 token efficiency 与 Agent 泛化。 当高质量数据增长变慢,真正重要的是把同一份数据吸收得更好;非 Adam / 矩阵正交化优化器、数据改写、更多参数与更强 post-training,都是围绕这个目标。
4. Agent 最大瓶颈不是会不会用工具,而是能否泛化到长尾工具。 Benchmarks 很容易诱导单点过拟合;杨植麟认为要用更 AI-native 的方式训练 AI,让模型参与对齐研究、训练流程和下一代模型研发,才能用“L4 解决 L3”。
左侧点选章节,中间看主线拆解,右侧切换术语工具箱。
每张卡都对应访谈里的一个技术判断,可直接跳回原音频。
这不是鸡汤,而是一种研发节奏:强化学习解决一批问题,会展开评估、验证、泛化等新问题。AI 公司真正的日常,是把新问题变成下一段山路。
强推理是在脑内不断猜想与验证;Agent 是边思考边操作工具。两者都是推理时扩展,只是一个扩 token,一个扩交互轮次。
Reasoning 和 Agent 可以并行推进;要做好 Agent 又需要更强推理。Innovation 和 Organization 也可能提前出现,比如让 K2 参与 K3 的研发。
训练更快不等于更聪明;把同一份高质量 token 吸收得更好,才提高模型上限。K2 的优化器、数据改写和参数规模选择,都围绕这个问题展开。
真正通用的 Agent 不该只会常见工具,而要能读懂公司内部数据库、私人文档、定制 API。今天的 benchmark 很容易把模型带向单点过拟合。
在 Agent 产品里,模型、工具、上下文和环境要在训练时就整合好。模型训完,产品大部分已经完成;交互层是很重要,但更像最后的增益。
时间有限时,先听这几个片段。
适合复盘、做笔记或快速给别人讲这一期。
推理时扩展。可以扩思考 token,也可以扩 Agent 交互轮次,目标都是让模型在回答时花更多计算解决更复杂任务。
杨植麟用来形容强推理模型:不与外界交互,只在脑内反复猜想、验证、修正。
能多轮使用工具、接收环境反馈并调整下一步动作的模型。关键词是多轮和工具。
同样高质量数据下,模型能吸收出多少智能。数据墙出现后,这比单纯训练更快更关键。
访谈中提到的基于矩阵正交化思路的新优化器路线,目标是提升 token efficiency。ASR 对名称有误识别,页面避免强行定名。
产品能力在训练模型时已嵌入工具、上下文和环境,模型训练完成后,产品核心也基本成型。
让模型参与训练、对齐、评估、实验分析和下一代模型研发,用 AI 训练 AI 来突破人工任务设计的泛化瓶颈。
奖励定义过窄时,系统会把指标刷高却没有真正达成目标。杨植麟把它类比到团队管理。
本页基于 SiliconFlow FunAudioLLM/SenseVoiceSmall 分块转写整理。由于接口只返回文本,时间戳是 180 秒切片范围,不是逐字级时间戳。ASR 中“杨志琳/杨志林/志玲”均整理为“杨植麟”;“Kwo/KR/K two/黑度”等根据语境整理为 Kimi/K2;“IL/强学习”等按上下文理解为 RL / 强化学习。涉及优化器具体名称处,保留“非 Adam / 矩阵正交化优化器”这一更稳妥表达。
每段约 10 分钟:一段完整概述 + 本段全部讨论点 + 一句原话摘引。支持关键词过滤,点击时间戳可跳回音频复听。