ABAB Pedia

John Schulman

John Schulman 是人工智能研究者,Thinking Machines Lab 共同創始人兼首席科學家、OpenAIOpenAIOpenAI是2015年創立的人工智能研究與產品機構,開發GPT系列模型、ChatGPT、Codex及開發者API,並開展圖像、語音、視頻與智能代理研究。2025年重組後,非營利的OpenAI Foundation繼續控制營利主體OpenAI Group PBC。其發展涉及大規模融資與算力合作,也伴隨治理、版權、隱私及人工智能安全爭議。點擊查看完整詞條 共同創始人。他的研究涉及深度強化學習和 AI 對齊,是 TRPO、GAE、PPO 等算法論文的主要作者之一,曾領導參與 ChatGPTChatGPTChatGPT是OpenAI於2022年11月30日推出的生成式人工智能助手,通過網頁和應用提供對話、寫作、編程、搜索、文件分析及圖像和語音交互等服務。產品從免費研究預覽發展為面向個人、企業和教育機構的多種方案,並逐步增加深度研究、學習模式和跨應用任務執行能力。其應用也引發有關事實準確性、個人隱私、版權、教育及青少年安全的持續討論。點擊查看完整詞條 開發的強化學習團隊,並在 AnthropicAnthropicAnthropic是一家於2021年成立的人工智能研究與產品公司,開發Claude模型、助手及Claude Code等工具,並以公益公司形式運營。Dario Amodei與Daniela Amodei為共同創辦人,其研究涉及模型安全、可解釋性和可控性。點擊查看完整詞條 從事對齊研究。

本頁目錄15 節
詞條資料

求學:從物理轉向機器人與機器學習

John Schulman 本科在加州理工學院學習物理,隨後進入加州大學伯克利分校的神經科學博士項目。在實驗室輪轉期間,他對 Pieter Abbeel 的機器人研究產生興趣,轉入電氣工程與計算機科學系。⁠[1]

他早期嘗試讓 PR2 機器人完成打結等操作。反覆為具體演示編寫複雜工程方案的經歷,使他開始思考如何通過數據和試錯學習提高機器人的適應能力,繼而把研究重點轉向深度強化學習。⁠[1]

研究信賴域策略優化與優勢估計

2015年,Schulman 與 Sergey Levine、Philipp Moritz、Michael I. Jordan 和 Pieter Abbeel 等合作提出信賴域策略優化(TRPO)。論文從控制策略更新幅度入手改善強化學習訓練穩定性,並在模擬機器人運動和 Atari 遊戲任務中進行了實驗。⁠[2]

同年,他作為第一作者發表廣義優勢估計(GAE)研究,利用價值函數降低策略梯度估計的方差,在偏差與方差之間進行權衡。這項工作與信賴域優化結合,用於訓練模擬機器人完成行走、奔跑和起身等動作。⁠[3]

共同創辦 OpenAI

2015年12月11日,OpenAI 的成立公告將 Schulman 列為創始團隊成員。該機構當時以非營利人工智能研究公司的形式成立,提出推動數字智能發展並使其惠及人類的目標。⁠[4]

Schulman 後來回憶,OpenAI 願意認真討論通用人工智能的長期目標,這種研究環境吸引了他。加入時,他仍處於博士研究的收尾階段。⁠[1]

完成伯克利博士研究

2016年,Schulman 獲得伯克利計算機科學博士學位,導師為 Pieter Abbeel。其博士論文《Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs》於12月16日收入學校技術報告庫。⁠[5][6]

論文把強化學習視為最大化期望回報的優化問題,研究策略更新的可靠性、樣本效率和梯度估計,並將相關方法擴展到隨機計算圖等更一般的學習問題。⁠[5]

合作提出 PPO 算法

2017年7月,Schulman 與 Filip Wolski、Prafulla Dhariwal、Alec Radford 和 Oleg Klimov 合作發表《Proximal Policy Optimization Algorithms》,提出近端策略優化(PPO)。他是該論文第一作者。⁠[7]

PPO 交替進行環境交互採樣與目標函數優化,使同批數據可以用於多輪小批量更新。論文報告,這種方法在模擬機器人和 Atari 基準中兼顧實現簡潔性、樣本效率與訓練時間。⁠[7]

入選全球青年創新者榜單

2018年,Schulman 入選 MIT Technology Review 全球 Innovators Under 35 榜單,所屬領域為人工智能與機器人。人物介紹關注他通過遊戲測試強化學習算法、探索已學技能如何遷移到新情境的研究。⁠[8]

參與 InstructGPT 與 ChatGPT 研發

2022年3月發表的 InstructGPT 論文將 Schulman 列為共同作者。團隊結合人類示範、輸出排序和基於人類反饋的強化學習,改進語言模型遵循用戶意圖的能力;論文同時指出,模型仍會犯簡單錯誤。⁠[9]

2022年11月30日,OpenAI 推出 ChatGPT。首發說明介紹了對話數據、人類反饋獎勵模型和 PPO 微調流程。Schulman 領導了參與 ChatGPT 開發的強化學習團隊,並在2022至2024年間共同領導後訓練團隊。⁠[10][11]

討論語言模型的真實性問題

2023年4月19日,Schulman 在伯克利發表題為“Reinforcement Learning from Human Feedback: Progress and Challenges”的演講,討論語言模型生成看似可信卻不真實內容的原因。⁠[12]

他指出,模型有時會順著錯誤前提繼續回答,也可能在不確定時進行猜測。他認為,允許模型表達不知道,以及通過強化學習改進其行為,是提高真實性的研究方向。⁠[12]

離開 OpenAI 加入 Anthropic

2024年8月5日,Schulman 在公開聲明中宣佈離開 OpenAI,加入 Anthropic。他表示,希望更集中地研究 AI 對齊,並回到更多親自參與的技術工作;他明確說明,這一決定並非因為 OpenAI 缺乏對對齊研究的支持。⁠[13]

聲明中,他也強調 ChatGPT 的成果來自團隊協作,特別提到 Barret Zoph 等同事的貢獻。其個人履歷記載,他隨後在 Anthropic 的 Alignment Science 團隊開展研究。⁠[13][11]

共同創辦 Thinking Machines Lab

2025年2月,Thinking Machines Lab 對外公佈成立,Mira Murati 擔任首席執行官,Schulman 擔任首席科學家。他的個人網站將這一職務標為共同創始人兼首席科學家。⁠[14][11]

公司將研究方向表述為,讓 AI 更易理解、能夠適應不同使用者的需求,並支持人與 AI 協作。其公開介紹強調研究與產品共同迭代,以及分享技術論文、代碼和經驗。⁠[15]

獲得伯克利校友榮譽

2025年,Schulman 獲得伯克利 Mark Bingham 青年校友傑出成就獎,列入5月22日 Charter Gala 的表彰名單。同年,他還獲得伯克利計算機科學傑出校友獎。⁠[16][6]

發表 LoRA 微調研究

2025年9月29日,Schulman 與 Thinking Machines Lab 同事發表《LoRA Without Regret》,比較低秩適配(LoRA)和全參數微調在監督學習及強化學習中的表現。⁠[17]

研究報告,在適配容量足夠、應用層與超參數設置合適的實驗條件下,LoRA 可接近全參數微調的樣本效率和最終表現;當數據量超過容量,或部分大批量訓練設置不合適時,也會出現性能差距。⁠[17]

討論 AI 自我改進與人類目標

在這場討論中,他區分了“決定應當追求什麼目標”和“優化已確定的目標”,認為前者仍需要人類持續參與。這是他對 AI 發展與對齊工作的判斷。⁠[18]

公開賬號與關聯機構

Schulman 的個人網站為 https://joschu.net(在新窗口打開),公開 X 賬號為 @johnschulman2(https://x.com/johnschulman2(在新窗口打開))。⁠[11][19]

Thinking Machines Lab:共同創始人兼首席科學家;OpenAI:共同創始人及曾任後訓練團隊共同負責人;Anthropic:曾在 Alignment Science 團隊從事研究。⁠[11]

來源

  1. ChatGPT architect, Berkeley alum John Schulman on his journey with AI(在新窗口打開)
  2. Trust Region Policy Optimization(在新窗口打開)
  3. High-Dimensional Continuous Control Using Generalized Advantage Estimation(在新窗口打開)
  4. Introducing OpenAI(在新窗口打開)
  5. Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs(在新窗口打開)
  6. CS Distinguished Alumni Award Winners(在新窗口打開)
  7. Proximal Policy Optimization Algorithms(在新窗口打開)
  8. John Schulman — Innovators Under 35(在新窗口打開)
  9. Training language models to follow instructions with human feedback(在新窗口打開)
  10. Introducing ChatGPT(在新窗口打開)
  11. John Schulman's Homepage(在新窗口打開)
  12. Berkeley Talks: ChatGPT developer John Schulman on making AI more truthful(在新窗口打開)
  13. John Schulman:关于离开 OpenAI 加入 Anthropic 的说明(在新窗口打開)
  14. Former OpenAI CTO Mira Murati launches Thinking Machines Lab(在新窗口打開)
  15. Thinking Machines Lab(在新窗口打開)
  16. Berkeley Charter Gala 2025(在新窗口打開)
  17. LoRA Without Regret(在新窗口打開)
  18. AI researchers debate how close we are to recursive self-improvement(在新窗口打開)
  19. John Schulman (@johnschulman2)(在新窗口打開)