Podcast SummaryBV1iVoVBgERD小米大模型 / Agent 范式

罗福莉访谈:AI 范式已然巨变、OpenClaw 与智能体框架

这期 3 小时 35 分钟的访谈,录制于 OpenClaw 引爆与小米 MiMo 新一代模型发布之后。小米大模型负责人罗福莉复盘了她如何在春节被 OpenClaw 点燃,进而重估智能体框架、后训练算力、卡的分配、模型结构与组织形态。她的核心判断是:AI 范式已然巨变,上一个时代的成功并不意味着下一个时代的领先。

核心心法与宏观判断

先把整期最关键的范式判断压成可复述的几句话。

1. OpenClaw 是范式分界点。 罗福莉把 OpenClaw 定义为「划时代的 agent 框架」:它不是 Claude Code 套壳,而是用整套 agent 编排去弥补模型短板,让一个中层模型也能在 85% 的场景逼近 Claude Opus 4.6 的表现。

2. Agent 范式很吃 Post-train。 过去预训练比后训练是 33:1、15:1,今年顶尖团队已经到 1:1;后训练周期从「一个月」拉长到「半年到一年」,很多预训练期定死的假定都会失效。

3. 卡的分配比例变了。 她给出的合理比例是研究:预训练:后训练 = 3:1:1,研究卡要比正式训练卡还多。在 agent 范式下,卡(尤其推理卡)反而成了最关键的瓶颈。

4. 组织要用新方式重建。 无职级、无分组、扁平、靠热爱驱动;她认为环境比经验更重要,预训练的人会自然流向后训练,招大二大三的本科生要的正是「未被污染」的想象力。

章节深度交互地图

左侧点选章节,中间看主线拆解,右侧切换概念工具箱。

关键概念卡片

每张卡都对应访谈里的一个判断,可直接跳回原音频。

底层判断

OpenClaw moment 更长也更深远

它没有 o1 那种「数学代码可量化」的清晰界定,而是能量慢慢溢出到更多人能感知的场景。前序章节太久,所以大家不觉得它新,但它会持续加速。

智能体框架

框架是「中间层」,UI 是最薄的一层

agent 框架同时定义人机交互层和与模型沟通那一层,能感知模型长短板并做成本调度。这个中间层可以做得非常厚重,前端 UI 反而不再关键。

群体智能

用一群人的智慧去改框架

近百人在一个飞书群里疯狂改 OpenClaw,几小时叠一轮,没人把它改坏,反而越来越智能。她认为这是 AGI 到来前必须出现的前兆。

后训练

Agent 范式很吃 Post-train

后训练算力已经与预训练相当,周期拉长到半年一年。这意味着你在预训练期定死的卡型、上下文长度等假定,做着做着就会失效。

卡的分配

研究:预训练:后训练 = 3:1:1

研究卡是正式训练卡的 3-5 倍。idea 诞生和写代码都很快,真正卡住你的是 GPU——卡反而成了最关键的制约项。

模型结构

Hybrid Attention + MTP,放弃 MLA

为 long context 效率而设计:滑动窗口层与全局注意力层做到 7:1,省 KV cache;再用 MTP 吃掉富余算力、加速推理,而且因为会被 verify,所以不引入幻觉。

入场券

ET(1T+)基座是 agent 时代入场券

要做到接近 Claude Opus 4.6 的 agent 水平,至少需要一 T 以上参数规模,再加上后训练的敏捷性,二者缺一不可。国内目前只有少数团队同时具备。

全模态

把音频离散化塞进 LLM

用多层 RVQ 做近乎无损的离散音频建模,统一到 next-token 范式;图片还在进行中。原生全模态让 Omni 的世界感知和情商更强,但 benchmark 上纹丝不动。

优先必听精彩时刻

时间有限时,先听这十段。

  1. 春节通宵初体验:凌晨两点装好,聊到六点天亮,第一次感到 OpenClaw「有灵魂、有温度」。
  2. 框架是中间层:agent 框架同时定义交互层和模型沟通层,UI 是最薄的一层。
  3. 不用就落后:给团队下指令——第二天对话没超 100 轮的可以直接辞职,目的只是逼大家去体验。
  4. 研究节奏被改变:以前两周的研究流程,现在一两小时做完,十个 idea 可以并行验证、交叉检验。
  5. Reward 设计保密:长任务的 correward 设计是当前的秘密,做到很大量级后会开源告诉大家。
  6. 很吃 post-train:预训练比后训练从 33:1、15:1 走到 1:1,周期拉长到半年一年。
  7. 卡的分配 3:1:1:研究卡是训练卡的 3-5 倍,卡成为最关键瓶颈。
  8. AGI 时间线提前:从 flash 的 20%,今年到 60-70%,她认为两年内可能实现。
  9. R1 的真正启示:外界看到的是 R1,她在内部感知到的是模型开训前对团队与组织的调整。
  10. 环境比经验重要:能力一两个月就能习得,她只在乎初始化和上限,招大二大三「未被污染」的人。

术语与概念索引

适合复盘、做笔记或快速给别人讲这一期。

OpenClaw

开源的智能体框架,脱胎于 Claude Code,但更强调端到端完成日常任务、分层记忆、多模型自主调度、定时/心跳任务与远程操控。社区迭代极快,后被 OpenAI 收购,但仍保持开源属性。

智能体框架

介于人与模型之间的「中间层」,既定义人机交互,又定义与模型的沟通与调度。可以做得很厚重,而前端 UI 是最薄的一层。

Post-train(后训练)

Agent 范式下极度依赖的环节,算力投入已与预训练相当(1:1),周期拉长到半年至一年,倒逼预训练期的很多假定重估。

卡的分配比例

研究:预训练:后训练约为 3:1:1;研究卡通常是正式训练卡的 3-5 倍。推理卡的需求量比训练还高很多。

群体智能

用一大群人(乃至全人类)共同改进 agent 框架与数据,让框架和模型快速自迭代。OpenClaw 开源社区是典型样本。

自学习 / 自迭代

模型与 agent 框架同步进化:框架吸收人的智慧,人的经验先进框架、最终沉淀进模型参数。

Hybrid Attention

滑动窗口注意力层 + 全局注意力层按比例混合(Pro 做到 7:1),为长上下文效率与更小的 KV cache 而设计。

MTP

Multi-Token Prediction,多 token 预测。吃掉 hybrid 结构的富余算力、加速推理;因为预测结果会被 verify 校验,所以不引入幻觉。

MLA / MA

DeepSeek 系列为 H 卡访存/计算比设计的高效注意力,长文省 KV,但结构「太满」、难叠 MTP,被认为不那么适配 agent 范式。

ET / 一T 基座

一万亿参数以上的基础模型,被视为 agent 时代对标 Claude Opus 4.6 的「入场券」,需再叠加后训练敏捷性。

全模态(Omni)

原生联合理解视频/音频/图片/文本;把音频用多层 RVQ 离散化统一进 LLM。世界感知与情商更强,但难在 benchmark 体现。

Code 的泛化性

软件工程是长上下文、可验证、长程任务,在预训练、RL、agent 三次范式转变中都「戳中那个点」,天然易 scaling 到通用领域。

转写注意事项

本页原始 ASR 已按 OpenClaw、Claude Code、Claude Opus、MLA、Omni、DeepSeek、Qwen、Llama、MiMo 等术语校正。末尾精读区改为章节级解构,不再直接展示逐字稿;时间戳用于回听定位,API 价格和模型命名等细节仍以官方口径为准。

十分钟切片精读(12 段覆盖全片 3 小时 35 分)

用已精修的章节地图重排最后一部分:每段约 10-20 分钟,聚焦 OpenClaw、后训练、全模态和组织判断。