Podcast SummaryBV1hFe1zSEXpKimi / Moonshot AI

杨植麟访谈:K2、Agentic LLM 与站在无限的开端

这期约 100 分钟的访谈把 Kimi 创始人杨植麟过去一年的技术判断压缩成一条主线:AI 的进步不是抵达某个静态终点,而是在“问题不可避免、问题可以解决”的循环里,用更强的推理、Agent、创新与组织能力继续爬一座没有尽头的雪山。

核心心法与宏观判断

先把整期最重要的技术与组织判断压成可复述的几句话。

1. AI 不是登月,而是一座可能没有尽头的雪山。 杨植麟反复借《The Beginning of Infinity》的框架解释研发状态:每解决一个问题,知识边界就扩大,同时制造新问题。AGI 更像方向而不是台阶,最重要的是持续爬升。

2. 过去一年的范式变化是 test-time scaling。 一条路线是强推理模型在脑内反复提出猜想并自我验证;另一条路线是 Agent 在多轮交互中使用工具、接收外界反馈。前者像“缸中之脑”,后者让模型把大脑接到世界。

3. K2 的核心叙事是 token efficiency 与 Agent 泛化。 当高质量数据增长变慢,真正重要的是把同一份数据吸收得更好;非 Adam / 矩阵正交化优化器、数据改写、更多参数与更强 post-training,都是围绕这个目标。

4. Agent 最大瓶颈不是会不会用工具,而是能否泛化到长尾工具。 Benchmarks 很容易诱导单点过拟合;杨植麟认为要用更 AI-native 的方式训练 AI,让模型参与对齐研究、训练流程和下一代模型研发,才能用“L4 解决 L3”。

章节深度交互地图

左侧点选章节,中间看主线拆解,右侧切换术语工具箱。

关键概念卡片

每张卡都对应访谈里的一个技术判断,可直接跳回原音频。

研究心法

问题不可避免,但问题可以解决

这不是鸡汤,而是一种研发节奏:强化学习解决一批问题,会展开评估、验证、泛化等新问题。AI 公司真正的日常,是把新问题变成下一段山路。

模型范式

缸中之脑 vs 接入世界的 Agent

强推理是在脑内不断猜想与验证;Agent 是边思考边操作工具。两者都是推理时扩展,只是一个扩 token,一个扩交互轮次。

路线图

L1 到 L5 不是线性台阶

Reasoning 和 Agent 可以并行推进;要做好 Agent 又需要更强推理。Innovation 和 Organization 也可能提前出现,比如让 K2 参与 K3 的研发。

K2 技术

高质量数据变慢后,拼的是 token efficiency

训练更快不等于更聪明;把同一份高质量 token 吸收得更好,才提高模型上限。K2 的优化器、数据改写和参数规模选择,都围绕这个问题展开。

泛化瓶颈

Agent 最大挑战是长尾工具泛化

真正通用的 Agent 不该只会常见工具,而要能读懂公司内部数据库、私人文档、定制 API。今天的 benchmark 很容易把模型带向单点过拟合。

产品判断

模型级产品仍然成立

在 Agent 产品里,模型、工具、上下文和环境要在训练时就整合好。模型训完,产品大部分已经完成;交互层是很重要,但更像最后的增益。

优先必听精彩时刻

时间有限时,先听这几个片段。

  1. “无限的开端”框架: 问题不可避免,但问题可以解决,AI 研发就是不断扩展知识边界。
  2. 强推理模型的本质: 模型在脑内多次提出猜想并自我验证,从单次输出变成多次尝试。
  3. Agentic LLM 的定义: 多轮操作工具,边思考边接收外界状态更新。
  4. K1.5 与 K2 的分工: 前者验证强化学习路线,后者强调好的 base model 和 token efficiency。
  5. Agent = 多轮 + 工具: 从“缸中之脑”到可以连接互联网、代码、内部数据库和定制 API。
  6. 长上下文必须保智商: 百万级上下文不只要长,还要在很长时仍然“脑子好用”。
  7. 下一代模型方向: K2 的性能还没榨干,接下来是更多 post-training、下一代 base model 和多模态。
  8. 用 RL / SFT 管理团队: 组织创新也像强化学习,奖励设计过窄会 reward hacking,SFT 过多会失去创造力。

术语与概念索引

适合复盘、做笔记或快速给别人讲这一期。

test-time scaling

推理时扩展。可以扩思考 token,也可以扩 Agent 交互轮次,目标都是让模型在回答时花更多计算解决更复杂任务。

缸中之脑

杨植麟用来形容强推理模型:不与外界交互,只在脑内反复猜想、验证、修正。

Agentic LLM

能多轮使用工具、接收环境反馈并调整下一步动作的模型。关键词是多轮和工具。

token efficiency

同样高质量数据下,模型能吸收出多少智能。数据墙出现后,这比单纯训练更快更关键。

非 Adam 优化器

访谈中提到的基于矩阵正交化思路的新优化器路线,目标是提升 token efficiency。ASR 对名称有误识别,页面避免强行定名。

模型级产品

产品能力在训练模型时已嵌入工具、上下文和环境,模型训练完成后,产品核心也基本成型。

AI-native 训练

让模型参与训练、对齐、评估、实验分析和下一代模型研发,用 AI 训练 AI 来突破人工任务设计的泛化瓶颈。

reward hacking

奖励定义过窄时,系统会把指标刷高却没有真正达成目标。杨植麟把它类比到团队管理。

转写注意事项

本页基于 SiliconFlow FunAudioLLM/SenseVoiceSmall 分块转写整理。由于接口只返回文本,时间戳是 180 秒切片范围,不是逐字级时间戳。ASR 中“杨志琳/杨志林/志玲”均整理为“杨植麟”;“Kwo/KR/K two/黑度”等根据语境整理为 Kimi/K2;“IL/强学习”等按上下文理解为 RL / 强化学习。涉及优化器具体名称处,保留“非 Adam / 矩阵正交化优化器”这一更稳妥表达。

十分钟切片精读(10 段覆盖全片 1 小时 40 分)

每段约 10 分钟:一段完整概述 + 本段全部讨论点 + 一句原话摘引。支持关键词过滤,点击时间戳可跳回音频复听。