*本文经过Qwen 3.8-Max润色。

2026年已过大半,我也刚刚结束了人生的第一份正式工作。此时此刻,终于有空做一个简短的年度回顾。

流水账

1-2月: 一边学LLM,一边面试;终于拿到了第一个offer。度过了新年和除夕。收到了朋友送的科研春联;顺便也给学校实验室贴了一张,开光一下。

这一年的春晚,宇树等机器人集体亮相,具身智能也算真正出圈了。

给您拜年

给您拜年

3月: 陆续拿到了几个不错的offer;最终决定去Qwen,想做全世界最好的开源大模型。这个月,祖师爷Richard Sutton和Andrew Barto因发明强化学习荣获图灵奖。Rich对研究的热爱与坚持、对AGI的独到见解以及对细节的极致把控,都令人深感敬佩。Amii内部也举办了一场小小的庆祝活动,大家都很开心。

The Turing Award Celebration for Rich in Amii

The Turing Award Celebration for Rich in Amii

本科刚接触RL时,我就被它的通用性和潜在的巨大影响力所折服,随即all in了这个方向的PhD和Master申请。那时研究RL的老师还很少,最终我来到了Edmonton这个冰天雪地的“破”地方。一晃七年已过,AI研究已发生天翻地覆的变化。无论是对我个人还是整个领域而言,前方都有很长的路要走。但在我心中,RL依然是通往AGI的必由之路。

临近月底,深感当下从事LLM post-training的人大多并不真正理解RL,于是决定写一篇科普博客,系统梳理相关的RL算法。没想到发表后颇受欢迎,浏览量恐怕比我所有论文的阅读量加起来还要多……

4月:开始撰写thesis,着手准备毕业。这个月,姚顺雨发表了博客The Second Half,被各大公众号广泛转载。至于后来他领着惊人的薪酬加入腾讯领导大模型研发,就是另一个故事了。随着工作尘埃落定,整个人终于松弛下来,去听了贝多芬音乐会,也重温了《幽灵公主》。

5月: 继续写thesis,参加Upper Bound。有幸受邀参加Openmind在马来西亚举办的活动,第一次体验了潜水的快乐,也第一次住上了私人游艇。

6月: thesis东拼西凑,总算写得差不多了。随即开启北美小环游!从Vancouver飞回Edmonton休整几日,再飞往Toronto,接着乘火车前往Montreal,之后坐大巴穿过美加边境抵达Boston,然后飞去Chicago,最后在Seattle逗留数日后飞回Edmonton。

图片由ChatGPT生成

图片由ChatGPT生成

一路上除了独自旅行,每到一个城市都会去见朋友们,并一一告别。山高水远,下次再见不知道要何时了。回到屯里后便开始收拾行李,极限卖家具,月底回国!

7月: 修改thesis。一周蛙泳速成。去杭州见了十多年未见的初中班主任和同学;去深圳见了老朋友们。

8月: 前往北京入职阿里,开启北漂生活。这个月也终于完成了毕业答辩,学生时代正式画上句号,感谢所有帮助过我的人!此外,还逛了WRC 2025,见识了各式各样的机器人。国内具身智能的创业氛围真是浓厚,竞争也极其激烈。开始dating,dating App的自我介绍改了一轮又一轮,拿出找工作的态度对待找对象这件事。

PhD Thesis Acknowledgment

PhD Thesis Acknowledgment

9月: 周中忙工作,周末忙dating。我本不是个讲究仪式感的人,但今年在乔老师的安排下,去长安街骑行,吃了生日蛋糕,过了一个充满仪式感的生日。非常感谢乔老师。

10-11月: 国庆回家,和家人逛了逛水亭门,感叹老家也是好起来了。这个月还去参加了NICE社区的第一次线下讲座,上台分享了RL的基础理论。
经过两个多月的高强度dating,在一轮又一轮的约会中,身心都逐渐疲惫:相似的开场、相似的话题,对面的女嘉宾换了一位又一位,却始终没遇到互相喜欢的人。正当我双目低垂、快要丧失希望之时,未来的女朋友满怀笑意,兴冲冲地向我跑来。约会几次后,我们自然而然就在一起了。果然互相喜欢的人无需刻意追求,真正成熟的爱情都是双向奔赴。不再困于孤独的恐惧,也放下了爱的执念。

划掉!

划掉!

11月还去千岛湖参加了公司团建。

12月: 在忙碌的工作中飞快度过。和女朋友一起迎接了新年。

书文影乐

2025年,我一共观看了98部影视作品及各类视频。回看自己列下的片单,大多已印象模糊,有些甚至要查豆瓣才想起来。印象最深的是《太空丹迪》,音乐上头,剧情疯癫,真可谓梦到哪里画到哪里。 今年最喜欢的新乐队是“八仙 8Immortals”,专辑《巨人川》中的每一首都奇异迷幻、光怪陆离,很久没有过这样的体验了。

满打满算,今年只读了5本书。其中两本是传记:一本是《埃隆·马斯克传》,另一本是美国副总统万斯的自传《乡下人的悲歌》。马斯克不愧是当代最伟大的企业家,但也确实不是个容易共事的人。

RLC 2025因毕业回国未能成行,但后来在YouTube补看了Dale Schuurmans的演讲Language Models and Computation。这是我今年听过最有insight的演讲了:长久以来,机器学习和深度学习的教科书多从统计学视角切入,分析各种算法与学习现象;而Dale的演讲将人拉回传统的计算机科学视角,从计算复杂性理论出发,重新审视Bellman equation和value function。最大的启发是,解决不同问题所需的计算复杂度各异,因此应对不同复杂度的问题,所需的最低计算量也各不相同。Think as a computer scientist, not just as a machine learning researcher or statistician.
说起来,Dale差点成为我的PhD导师。他在UAlberta任教多年,同时在Google Brain兼职,是我见过最聪明、最有见地的researcher之一,丝毫不亚于Rich。最难能可贵的是,尽管早已功成名就,他至今仍会亲自写代码做实验。

大模型

这一年,大模型继续狂飙突进。DeepSeek-R1与Kimi k1.5的tech report在年初相继发布,RLHF范式渐趋衰微,所谓的Agentic RL逐渐兴起。Chatbot不再是LLM唯一的应用形态;大模型开始学会调用各类工具、操控电脑,去完成复杂的长程任务。 而我也从一个LLM门外汉,逐步参与到Qwen模型的训练之中。 趁着年终总结,在这里记录一下2025年大模型的碎碎念。

  • Deep learning system本质上仍是function approximator,并不适合做严格的数学计算与符号推理。专业的事情应该交给专业的tool去做,效率更高,性能更好,成本也更低。
  • 无论是RLHF还是agentic RL,都未超出传统RL的理论框架。Recursive self-improvement (RSI) 本质上是在做meta learning。
  • 具身智能与大模型终将走向融合。The real world is more important and interesting.
  • 在我看来,如何低成本获取更准确、更密集的监督信号(reward signal),是实现AGI的最大bottleneck。若这一问题短期内无法解决,人们将不得不依靠积累更多高质量数据来绕过它:从“有多少人工就有多少智能”,转向“有多少高质量数据就有多少智能”。然而,问题本身的hardness并未被消解,只是被转移到了数据生产环节。
  • 正如深度学习曾彻底变革整个机器学习研究领域一样,大模型正在重塑深度学习研究本身。它取代了MLP、RNN、CNN、GAN、ResNet等传统架构,成为新的研究平台,广泛涵盖optimization、generalization、continual learning、memory、planning、safety、exploration、network architecture、meta-learning、robotics、AI for science等方向。大家正把过去在其他架构、其他领域做过的事情,在大模型领域重新做一遍。
  • 从探索novel idea的角度来看,工业界远远落后于学术界。因此即便身处顶尖AI lab,读paper依然有价值。工业界的优势在于,理论上能提供更多资源,快速验证idea是否work。对于有志于做research的AI researcher而言,当下的最优策略仍是去工业界做research。
  • Paper inflation愈发严重:每年产出的论文多到根本看不完。论文发表与否不再那么重要,但交流idea依然关键。顶级AI lab即便只发tech report、blog或arxiv,也会有大量读者。相应地,求职时个人论文数量不再那么重要,顶级AI lab的工作经历成了新的敲门砖。
  • 目前来看,整个领域对deep learning system的理论理解仍远远不够,且大幅落后于实验进展:understanding the learning dynamics of deep neural networks依然是一项艰巨但极有价值的任务。物理学的发展表明,一个学科的良性发展需要理论与实验共同进步,二者不能拉开太大差距,否则总有一方会拖后腿。当然也必须承认,如今的大模型确实很有用,已能解决诸多问题,极大提升了工作效率。
  • 点AI科技树不能过分集中,长期来看一枝独大对整个学科发展不利。当海量资本与人才一股脑涌入LLM这条拥挤的赛道,其他领域便会面临投入不足的困境。AI领域要实现长期可持续发展,同样需要做好exploration-exploitation trade-off。
  • 长期来看,人能做到的,AI必将能做到。因此除了掌权者与资本家,没有什么职业是绝对安全的。套用《资本论》中的一句话:程序员一手创造出了自己的掘墓人。
  • 读博这些年,我见过太多才华横溢的中国AI PhD。清北复交的AI博士们,丝毫不比海外培养的博士差。DeepSeek的成功也说明,中国不缺顶尖AI人才,更缺耐心资本和鼓励创新的环境。短期来看,GPU封锁是个问题,但也并非无解。长期来看,能否形成“技术-产品-消费-投资”的商业闭环,创造出真正提升生产力的AI工具,决定了这条路能走多远。
  • 在中美对抗的大背景下,AI领域的竞争势必更加激烈,早已超出纯粹的科研与技术范畴。未来十年的每一年,都会很刺激、很精彩。
  • 人类历史上的每一次工业革命都创造了巨额财富,深刻重塑了工作与生活方式。但与此同时,贫富差距也随之扩大,社会不稳定性加剧,分配问题因此变得愈发重要且迫在眉睫。

以上罗列的观点,站在2026年这个时间节点回望,许多已成为现实;剩下的就留待时间去检验吧。

漫长的成年式

2025年于我而言,是承上启下之年:漫长的学生时代落幕,更漫长的打工生涯开启。我获得了新的工作,也收获了久违的爱情;告别了生活多年的Edmonton,带着对RL的笃信与对AGI的信念,回到了家人身旁。走出象牙塔,归来已不再是少年。