ABAB Pedia

John Schulman

John Schulman 是人工智能研究者,Thinking Machines Lab 共同创始人兼首席科学家、OpenAIOpenAIOpenAI是2015年创立的人工智能研究与产品机构,开发GPT系列模型、ChatGPT、Codex及开发者API,并开展图像、语音、视频与智能代理研究。2025年重组后,非营利的OpenAI Foundation继续控制营利主体OpenAI Group PBC。其发展涉及大规模融资与算力合作,也伴随治理、版权、隐私及人工智能安全争议。点击查看完整词条 共同创始人。他的研究涉及深度强化学习和 AI 对齐,是 TRPO、GAE、PPO 等算法论文的主要作者之一,曾领导参与 ChatGPTChatGPTChatGPT是OpenAI于2022年11月30日推出的生成式人工智能助手,通过网页和应用提供对话、写作、编程、搜索、文件分析及图像和语音交互等服务。产品从免费研究预览发展为面向个人、企业和教育机构的多种方案,并逐步增加深度研究、学习模式和跨应用任务执行能力。其应用也引发有关事实准确性、个人隐私、版权、教育及青少年安全的持续讨论。点击查看完整词条 开发的强化学习团队,并在 Anthropic 从事对齐研究。

本页目录15
词条资料

求学:从物理转向机器人与机器学习

John Schulman 本科在加州理工学院学习物理,随后进入加州大学伯克利分校的神经科学博士项目。在实验室轮转期间,他对 Pieter Abbeel 的机器人研究产生兴趣,转入电气工程与计算机科学系。[1]

他早期尝试让 PR2 机器人完成打结等操作。反复为具体演示编写复杂工程方案的经历,使他开始思考如何通过数据和试错学习提高机器人的适应能力,继而把研究重点转向深度强化学习。[1]

研究信赖域策略优化与优势估计

2015年,Schulman 与 Sergey Levine、Philipp Moritz、Michael I. Jordan 和 Pieter Abbeel 等合作提出信赖域策略优化(TRPO)。论文从控制策略更新幅度入手改善强化学习训练稳定性,并在模拟机器人运动和 Atari 游戏任务中进行了实验。[2]

同年,他作为第一作者发表广义优势估计(GAE)研究,利用价值函数降低策略梯度估计的方差,在偏差与方差之间进行权衡。这项工作与信赖域优化结合,用于训练模拟机器人完成行走、奔跑和起身等动作。[3]

共同创办 OpenAI

2015年12月11日,OpenAI 的成立公告将 Schulman 列为创始团队成员。该机构当时以非营利人工智能研究公司的形式成立,提出推动数字智能发展并使其惠及人类的目标。[4]

Schulman 后来回忆,OpenAI 愿意认真讨论通用人工智能的长期目标,这种研究环境吸引了他。加入时,他仍处于博士研究的收尾阶段。[1]

完成伯克利博士研究

2016年,Schulman 获得伯克利计算机科学博士学位,导师为 Pieter Abbeel。其博士论文《Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs》于12月16日收入学校技术报告库。[5][6]

论文把强化学习视为最大化期望回报的优化问题,研究策略更新的可靠性、样本效率和梯度估计,并将相关方法扩展到随机计算图等更一般的学习问题。[5]

合作提出 PPO 算法

2017年7月,Schulman 与 Filip Wolski、Prafulla Dhariwal、Alec Radford 和 Oleg Klimov 合作发表《Proximal Policy Optimization Algorithms》,提出近端策略优化(PPO)。他是该论文第一作者。[7]

PPO 交替进行环境交互采样与目标函数优化,使同批数据可以用于多轮小批量更新。论文报告,这种方法在模拟机器人和 Atari 基准中兼顾实现简洁性、样本效率与训练时间。[7]

入选全球青年创新者榜单

2018年,Schulman 入选 MIT Technology Review 全球 Innovators Under 35 榜单,所属领域为人工智能与机器人。人物介绍关注他通过游戏测试强化学习算法、探索已学技能如何迁移到新情境的研究。[8]

参与 InstructGPT 与 ChatGPT 研发

2022年3月发表的 InstructGPT 论文将 Schulman 列为共同作者。团队结合人类示范、输出排序和基于人类反馈的强化学习,改进语言模型遵循用户意图的能力;论文同时指出,模型仍会犯简单错误。[9]

2022年11月30日,OpenAI 推出 ChatGPT。首发说明介绍了对话数据、人类反馈奖励模型和 PPO 微调流程。Schulman 领导了参与 ChatGPT 开发的强化学习团队,并在2022至2024年间共同领导后训练团队。[10][11]

讨论语言模型的真实性问题

2023年4月19日,Schulman 在伯克利发表题为“Reinforcement Learning from Human Feedback: Progress and Challenges”的演讲,讨论语言模型生成看似可信却不真实内容的原因。[12]

他指出,模型有时会顺着错误前提继续回答,也可能在不确定时进行猜测。他认为,允许模型表达不知道,以及通过强化学习改进其行为,是提高真实性的研究方向。[12]

离开 OpenAI 加入 Anthropic

2024年8月5日,Schulman 在公开声明中宣布离开 OpenAI,加入 Anthropic。他表示,希望更集中地研究 AI 对齐,并回到更多亲自参与的技术工作;他明确说明,这一决定并非因为 OpenAI 缺乏对对齐研究的支持。[13]

声明中,他也强调 ChatGPT 的成果来自团队协作,特别提到 Barret Zoph 等同事的贡献。其个人履历记载,他随后在 Anthropic 的 Alignment Science 团队开展研究。[13][11]

共同创办 Thinking Machines Lab

2025年2月,Thinking Machines Lab 对外公布成立,Mira Murati 担任首席执行官,Schulman 担任首席科学家。他的个人网站将这一职务标为共同创始人兼首席科学家。[14][11]

公司将研究方向表述为,让 AI 更易理解、能够适应不同使用者的需求,并支持人与 AI 协作。其公开介绍强调研究与产品共同迭代,以及分享技术论文、代码和经验。[15]

获得伯克利校友荣誉

2025年,Schulman 获得伯克利 Mark Bingham 青年校友杰出成就奖,列入5月22日 Charter Gala 的表彰名单。同年,他还获得伯克利计算机科学杰出校友奖。[16][6]

发表 LoRA 微调研究

2025年9月29日,Schulman 与 Thinking Machines Lab 同事发表《LoRA Without Regret》,比较低秩适配(LoRA)和全参数微调在监督学习及强化学习中的表现。[17]

研究报告,在适配容量足够、应用层与超参数设置合适的实验条件下,LoRA 可接近全参数微调的样本效率和最终表现;当数据量超过容量,或部分大批量训练设置不合适时,也会出现性能差距。[17]

讨论 AI 自我改进与人类目标

2026年9月,Schulman 与 Beren Millidge、Charlie O’Neill 参加 Dwarkesh Podcast 讨论,分析 AI 递归自我改进、泛化和研究自动化的条件。他认为,模型能力提升并不必然立即转化为同等幅度的科研生产力提升,判断力和自我检查能力仍可能形成瓶颈。[18]

在这场讨论中,他区分了“决定应当追求什么目标”和“优化已确定的目标”,认为前者仍需要人类持续参与。这是他对 AI 发展与对齐工作的判断。[18]

公开账号与关联机构

Schulman 的个人网站为 https://joschu.net(在新窗口打开),公开 X 账号为 @johnschulman2(https://x.com/johnschulman2(在新窗口打开))。[11][19]

Thinking Machines Lab:共同创始人兼首席科学家;OpenAI:共同创始人及曾任后训练团队共同负责人;Anthropic:曾在 Alignment Science 团队从事研究。[11]

来源

  1. ChatGPT architect, Berkeley alum John Schulman on his journey with AI(在新窗口打开)
  2. Trust Region Policy Optimization(在新窗口打开)
  3. High-Dimensional Continuous Control Using Generalized Advantage Estimation(在新窗口打开)
  4. Introducing OpenAI(在新窗口打开)
  5. Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs(在新窗口打开)
  6. CS Distinguished Alumni Award Winners(在新窗口打开)
  7. Proximal Policy Optimization Algorithms(在新窗口打开)
  8. John Schulman — Innovators Under 35(在新窗口打开)
  9. Training language models to follow instructions with human feedback(在新窗口打开)
  10. Introducing ChatGPT(在新窗口打开)
  11. John Schulman's Homepage(在新窗口打开)
  12. Berkeley Talks: ChatGPT developer John Schulman on making AI more truthful(在新窗口打开)
  13. John Schulman:关于离开 OpenAI 加入 Anthropic 的说明(在新窗口打开)
  14. Former OpenAI CTO Mira Murati launches Thinking Machines Lab(在新窗口打开)
  15. Thinking Machines Lab(在新窗口打开)
  16. Berkeley Charter Gala 2025(在新窗口打开)
  17. LoRA Without Regret(在新窗口打开)
  18. AI researchers debate how close we are to recursive self-improvement(在新窗口打开)
  19. John Schulman (@johnschulman2)(在新窗口打开)