投资未来不是口号,而是持续出现的策略
小时候提前学数学,后来做开源项目,最后想让十年后的自己有选择权,都是同一个动作:用现在的时间换未来的自由度。
这期约 123 分钟的访谈从奥数、OI、清华开源作业和天授讲到 OpenAI post-training RL infra:主线不是“天才传记”,而是一个人如何持续把信息差、研究痛点和真实需求,改造成可复用的工具与系统。
先把整期最重要的技术、职业和人生判断压成可复述的几句话。
1. 翁家翌的底层动作是“投资未来”。 从初中提前学高中数学,到结尾希望十年后的自己有资源和选择权,他一直在把现在的时间投向未来更大的自由度。
2. 开源在他这里不是人设,而是打破信息差的工具。 清华作业、天授、tuixue、签证查询系统都来自同一个判断:自己踩到的坑,如果别人也会踩,就把路标做出来。
3. OpenAI 后训练的关键不是神秘算法,而是正确 Infra。 reward 会骗人,benchmark 有噪声,系统到处有 bug;谁能更快更正确地迭代,谁就更接近好模型。
4. 他最强的职业策略是“卖铲子”。 做单个 research 不能 scale,但做所有人都要用的 RL infra,就能把个人贡献放大到多个模型 release。
左侧点选章节,中间看主线拆解,右侧切换术语工具箱。
每张卡都对应访谈里的一个判断,可直接跳回原音频。
小时候提前学数学,后来做开源项目,最后想让十年后的自己有选择权,都是同一个动作:用现在的时间换未来的自由度。
他不想让学弟学妹把十几个小时耗在低收益摸索里。开源不是炫耀答案,而是把隐形资源变成公共路标。
tuixue 的价值不在复杂技术,而在击中真实需求。对他来说,几行脚本如果帮到上千万人,就是有 impact 的工具。
天授抓住 RL 研究者想要好用、好改的需求。代码短不是唯一优点,真正关键是抽象一致,用户知道该改哪里。
idea 可以讨论,但能正确快速验证 idea 的 Infra 很难训练。对工业界 AI Lab 来说,能把系统搭稳的人极其重要。
这句话把大模型竞赛拉回现实:很多能力差距不是黑魔法,而是采样、训练、评估和分布式系统里的正确性差距。
reward 可能被 hacking,benchmark 有噪声,最后仍要真实交互和人类偏好投票。这是 RLHF 工业化最朴素也最困难的地方。
OpenAI 内部警觉的不是某个榜单,而是对方展示出的 Infra 和 cycle time。模型公司竞争越来越像生产系统竞争。
他把世界看成可能可预测的确定过程,但行动上仍选择继续投入,让未来的自己拥有资源和选择权。
时间有限时,先听这些片段。
适合复盘、做笔记或快速给别人讲这一期。
翁家翌开源的强化学习框架,强调轻量、好改、抽象一致,服务 RL 研究者快速实验。
疫情签证不确定性中做出的查询/通知工具,价值来自真实需求而不是复杂技术。
预训练之后对模型行为进行优化的阶段,包含 SFT、RLHF、PPO、评估和产品体验相关训练。
用人类反馈训练奖励模型,再用强化学习优化模型输出,使其更符合人类偏好。
强化学习中常用的策略优化算法。访谈中 GPT-4 上调通 PPO 是工业级后训练的重要节点。
模型把奖励指标刷高,却没有真正变好。人类评估和真实交互仍然不可替代。
支撑大模型强化学习训练的系统,包括采样、训练、吞吐、分布式、评估和数据流。
单位时间内正确迭代多少次。模型公司竞争中,迭代速度和成功率比单次榜单更关键。
代码库或组织中上下文和假设保持一致的能力;不一致会导致系统腐化和沟通成本上升。
OpenAI 的 open 不是无条件开源一切;产品低价触达普通人、公司生存和开源透明之间存在博弈。
尾声中讨论的世界观:如果世界可预测,人仍需要选择如何体验当下并投资未来。
他自定义的奖励函数:做出别人真的会用、会记住、会受益的东西。
本页基于 SiliconFlow FunAudioLLM/SenseVoiceSmall 分块转写整理。由于接口只返回文本,时间戳是 180 秒切片范围,不是逐字级时间戳。ASR 中“翁嘉译/翁嘉怡/翁嘉毅/冯佳怡/温家意”等均按题名整理为“翁家翌”;“opI/open eye/open air”按上下文整理为 OpenAI;“RO/RU/二人一法”按上下文理解为 RL / RL infra;“天售/天寿/填手”整理为天授/Tianshou;“退学/推学”整理为 tuixue。下方板块为约 10 分钟切片的精读总结;“原话”摘引已按语义修正转写噪声,接近但不逐字等于原音频。
每段约 10 分钟:一段完整概述 + 本段全部讨论点 + 一句原话摘引。支持关键词过滤,点击时间戳可跳回音频复听。