John Schulman
John Schulman 是人工智能研究者,Thinking Machines Lab 共同创始人兼首席科学家、OpenAIOpenAIOpenAI是2015年创立的人工智能研究与产品机构,开发GPT系列模型、ChatGPT、Codex及开发者API,并开展图像、语音、视频与智能代理研究。2025年重组后,非营利的OpenAI Foundation继续控制营利主体OpenAI Group PBC。其发展涉及大规模融资与算力合作,也伴随治理、版权、隐私及人工智能安全争议。点击查看完整词条 共同创始人。他的研究涉及深度强化学习和 AI 对齐,是 TRPO、GAE、PPO 等算法论文的主要作者之一,曾领导参与 ChatGPTChatGPTChatGPT是OpenAI于2022年11月30日推出的生成式人工智能助手,通过网页和应用提供对话、写作、编程、搜索、文件分析及图像和语音交互等服务。产品从免费研究预览发展为面向个人、企业和教育机构的多种方案,并逐步增加深度研究、学习模式和跨应用任务执行能力。其应用也引发有关事实准确性、个人隐私、版权、教育及青少年安全的持续讨论。点击查看完整词条 开发的强化学习团队,并在 Anthropic 从事对齐研究。
本页目录15 节
词条资料
求学:从物理转向机器人与机器学习
John Schulman 本科在加州理工学院学习物理,随后进入加州大学伯克利分校的神经科学博士项目。在实验室轮转期间,他对 Pieter Abbeel 的机器人研究产生兴趣,转入电气工程与计算机科学系。[1]
他早期尝试让 PR2 机器人完成打结等操作。反复为具体演示编写复杂工程方案的经历,使他开始思考如何通过数据和试错学习提高机器人的适应能力,继而把研究重点转向深度强化学习。[1]
2015年研究信赖域策略优化与优势估计
2015年,Schulman 与 Sergey Levine、Philipp Moritz、Michael I. Jordan 和 Pieter Abbeel 等合作提出信赖域策略优化(TRPO)。论文从控制策略更新幅度入手改善强化学习训练稳定性,并在模拟机器人运动和 Atari 游戏任务中进行了实验。[2]
同年,他作为第一作者发表广义优势估计(GAE)研究,利用价值函数降低策略梯度估计的方差,在偏差与方差之间进行权衡。这项工作与信赖域优化结合,用于训练模拟机器人完成行走、奔跑和起身等动作。[3]
2015年12月共同创办 OpenAI
2015年12月11日,OpenAI 的成立公告将 Schulman 列为创始团队成员。该机构当时以非营利人工智能研究公司的形式成立,提出推动数字智能发展并使其惠及人类的目标。[4]
Schulman 后来回忆,OpenAI 愿意认真讨论通用人工智能的长期目标,这种研究环境吸引了他。加入时,他仍处于博士研究的收尾阶段。[1]
2016年完成伯克利博士研究
2016年,Schulman 获得伯克利计算机科学博士学位,导师为 Pieter Abbeel。其博士论文《Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs》于12月16日收入学校技术报告库。[5][6]
论文把强化学习视为最大化期望回报的优化问题,研究策略更新的可靠性、样本效率和梯度估计,并将相关方法扩展到随机计算图等更一般的学习问题。[5]
2017年合作提出 PPO 算法
2017年7月,Schulman 与 Filip Wolski、Prafulla Dhariwal、Alec Radford 和 Oleg Klimov 合作发表《Proximal Policy Optimization Algorithms》,提出近端策略优化(PPO)。他是该论文第一作者。[7]
PPO 交替进行环境交互采样与目标函数优化,使同批数据可以用于多轮小批量更新。论文报告,这种方法在模拟机器人和 Atari 基准中兼顾实现简洁性、样本效率与训练时间。[7]
2018年入选全球青年创新者榜单
2018年,Schulman 入选 MIT Technology Review 全球 Innovators Under 35 榜单,所属领域为人工智能与机器人。人物介绍关注他通过游戏测试强化学习算法、探索已学技能如何迁移到新情境的研究。[8]
2022年参与 InstructGPT 与 ChatGPT 研发
2022年3月发表的 InstructGPT 论文将 Schulman 列为共同作者。团队结合人类示范、输出排序和基于人类反馈的强化学习,改进语言模型遵循用户意图的能力;论文同时指出,模型仍会犯简单错误。[9]
2023年讨论语言模型的真实性问题
2023年4月19日,Schulman 在伯克利发表题为“Reinforcement Learning from Human Feedback: Progress and Challenges”的演讲,讨论语言模型生成看似可信却不真实内容的原因。[12]
他指出,模型有时会顺着错误前提继续回答,也可能在不确定时进行猜测。他认为,允许模型表达不知道,以及通过强化学习改进其行为,是提高真实性的研究方向。[12]
2024年8月离开 OpenAI 加入 Anthropic
2024年8月5日,Schulman 在公开声明中宣布离开 OpenAI,加入 Anthropic。他表示,希望更集中地研究 AI 对齐,并回到更多亲自参与的技术工作;他明确说明,这一决定并非因为 OpenAI 缺乏对对齐研究的支持。[13]
2025年共同创办 Thinking Machines Lab
2025年2月,Thinking Machines Lab 对外公布成立,Mira Murati 担任首席执行官,Schulman 担任首席科学家。他的个人网站将这一职务标为共同创始人兼首席科学家。[14][11]
公司将研究方向表述为,让 AI 更易理解、能够适应不同使用者的需求,并支持人与 AI 协作。其公开介绍强调研究与产品共同迭代,以及分享技术论文、代码和经验。[15]
2025年获得伯克利校友荣誉
2025年9月发表 LoRA 微调研究
2025年9月29日,Schulman 与 Thinking Machines Lab 同事发表《LoRA Without Regret》,比较低秩适配(LoRA)和全参数微调在监督学习及强化学习中的表现。[17]
研究报告,在适配容量足够、应用层与超参数设置合适的实验条件下,LoRA 可接近全参数微调的样本效率和最终表现;当数据量超过容量,或部分大批量训练设置不合适时,也会出现性能差距。[17]
2026年9月讨论 AI 自我改进与人类目标
2026年9月,Schulman 与 Beren Millidge、Charlie O’Neill 参加 Dwarkesh Podcast 讨论,分析 AI 递归自我改进、泛化和研究自动化的条件。他认为,模型能力提升并不必然立即转化为同等幅度的科研生产力提升,判断力和自我检查能力仍可能形成瓶颈。[18]
在这场讨论中,他区分了“决定应当追求什么目标”和“优化已确定的目标”,认为前者仍需要人类持续参与。这是他对 AI 发展与对齐工作的判断。[18]
公开账号与关联机构
Schulman 的个人网站为 https://joschu.net(在新窗口打开),公开 X 账号为 @johnschulman2(https://x.com/johnschulman2(在新窗口打开))。[11][19]
Thinking Machines Lab:共同创始人兼首席科学家;OpenAI:共同创始人及曾任后训练团队共同负责人;Anthropic:曾在 Alignment Science 团队从事研究。[11]
来源
- ChatGPT architect, Berkeley alum John Schulman on his journey with AI(在新窗口打开)
- Trust Region Policy Optimization(在新窗口打开)
- High-Dimensional Continuous Control Using Generalized Advantage Estimation(在新窗口打开)
- Introducing OpenAI(在新窗口打开)
- Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs(在新窗口打开)
- CS Distinguished Alumni Award Winners(在新窗口打开)
- Proximal Policy Optimization Algorithms(在新窗口打开)
- John Schulman — Innovators Under 35(在新窗口打开)
- Training language models to follow instructions with human feedback(在新窗口打开)
- Introducing ChatGPT(在新窗口打开)
- John Schulman's Homepage(在新窗口打开)
- Berkeley Talks: ChatGPT developer John Schulman on making AI more truthful(在新窗口打开)
- John Schulman:关于离开 OpenAI 加入 Anthropic 的说明(在新窗口打开)
- Former OpenAI CTO Mira Murati launches Thinking Machines Lab(在新窗口打开)
- Thinking Machines Lab(在新窗口打开)
- Berkeley Charter Gala 2025(在新窗口打开)
- LoRA Without Regret(在新窗口打开)
- AI researchers debate how close we are to recursive self-improvement(在新窗口打开)
- John Schulman (@johnschulman2)(在新窗口打开)