John Schulman
John Schulman 是人工智能研究者,Thinking Machines Lab 共同創始人兼首席科學家、OpenAIOpenAIOpenAI是2015年創立的人工智能研究與產品機構,開發GPT系列模型、ChatGPT、Codex及開發者API,並開展圖像、語音、視頻與智能代理研究。2025年重組後,非營利的OpenAI Foundation繼續控制營利主體OpenAI Group PBC。其發展涉及大規模融資與算力合作,也伴隨治理、版權、隱私及人工智能安全爭議。點擊查看完整詞條 共同創始人。他的研究涉及深度強化學習和 AI 對齊,是 TRPO、GAE、PPO 等算法論文的主要作者之一,曾領導參與 ChatGPTChatGPTChatGPT是OpenAI於2022年11月30日推出的生成式人工智能助手,通過網頁和應用提供對話、寫作、編程、搜索、文件分析及圖像和語音交互等服務。產品從免費研究預覽發展為面向個人、企業和教育機構的多種方案,並逐步增加深度研究、學習模式和跨應用任務執行能力。其應用也引發有關事實準確性、個人隱私、版權、教育及青少年安全的持續討論。點擊查看完整詞條 開發的強化學習團隊,並在 AnthropicAnthropicAnthropic是一家於2021年成立的人工智能研究與產品公司,開發Claude模型、助手及Claude Code等工具,並以公益公司形式運營。Dario Amodei與Daniela Amodei為共同創辦人,其研究涉及模型安全、可解釋性和可控性。點擊查看完整詞條 從事對齊研究。
本頁目錄15 節
詞條資料
求學:從物理轉向機器人與機器學習
John Schulman 本科在加州理工學院學習物理,隨後進入加州大學伯克利分校的神經科學博士項目。在實驗室輪轉期間,他對 Pieter Abbeel 的機器人研究產生興趣,轉入電氣工程與計算機科學系。[1]
他早期嘗試讓 PR2 機器人完成打結等操作。反覆為具體演示編寫複雜工程方案的經歷,使他開始思考如何通過數據和試錯學習提高機器人的適應能力,繼而把研究重點轉向深度強化學習。[1]
2015年研究信賴域策略優化與優勢估計
2015年,Schulman 與 Sergey Levine、Philipp Moritz、Michael I. Jordan 和 Pieter Abbeel 等合作提出信賴域策略優化(TRPO)。論文從控制策略更新幅度入手改善強化學習訓練穩定性,並在模擬機器人運動和 Atari 遊戲任務中進行了實驗。[2]
同年,他作為第一作者發表廣義優勢估計(GAE)研究,利用價值函數降低策略梯度估計的方差,在偏差與方差之間進行權衡。這項工作與信賴域優化結合,用於訓練模擬機器人完成行走、奔跑和起身等動作。[3]
2015年12月共同創辦 OpenAI
2015年12月11日,OpenAI 的成立公告將 Schulman 列為創始團隊成員。該機構當時以非營利人工智能研究公司的形式成立,提出推動數字智能發展並使其惠及人類的目標。[4]
Schulman 後來回憶,OpenAI 願意認真討論通用人工智能的長期目標,這種研究環境吸引了他。加入時,他仍處於博士研究的收尾階段。[1]
2016年完成伯克利博士研究
2016年,Schulman 獲得伯克利計算機科學博士學位,導師為 Pieter Abbeel。其博士論文《Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs》於12月16日收入學校技術報告庫。[5][6]
論文把強化學習視為最大化期望回報的優化問題,研究策略更新的可靠性、樣本效率和梯度估計,並將相關方法擴展到隨機計算圖等更一般的學習問題。[5]
2017年合作提出 PPO 算法
2017年7月,Schulman 與 Filip Wolski、Prafulla Dhariwal、Alec Radford 和 Oleg Klimov 合作發表《Proximal Policy Optimization Algorithms》,提出近端策略優化(PPO)。他是該論文第一作者。[7]
PPO 交替進行環境交互採樣與目標函數優化,使同批數據可以用於多輪小批量更新。論文報告,這種方法在模擬機器人和 Atari 基準中兼顧實現簡潔性、樣本效率與訓練時間。[7]
2018年入選全球青年創新者榜單
2018年,Schulman 入選 MIT Technology Review 全球 Innovators Under 35 榜單,所屬領域為人工智能與機器人。人物介紹關注他通過遊戲測試強化學習算法、探索已學技能如何遷移到新情境的研究。[8]
2022年參與 InstructGPT 與 ChatGPT 研發
2022年3月發表的 InstructGPT 論文將 Schulman 列為共同作者。團隊結合人類示範、輸出排序和基於人類反饋的強化學習,改進語言模型遵循用戶意圖的能力;論文同時指出,模型仍會犯簡單錯誤。[9]
2023年討論語言模型的真實性問題
2023年4月19日,Schulman 在伯克利發表題為“Reinforcement Learning from Human Feedback: Progress and Challenges”的演講,討論語言模型生成看似可信卻不真實內容的原因。[12]
他指出,模型有時會順著錯誤前提繼續回答,也可能在不確定時進行猜測。他認為,允許模型表達不知道,以及通過強化學習改進其行為,是提高真實性的研究方向。[12]
2024年8月離開 OpenAI 加入 Anthropic
2024年8月5日,Schulman 在公開聲明中宣佈離開 OpenAI,加入 Anthropic。他表示,希望更集中地研究 AI 對齊,並回到更多親自參與的技術工作;他明確說明,這一決定並非因為 OpenAI 缺乏對對齊研究的支持。[13]
2025年共同創辦 Thinking Machines Lab
2025年2月,Thinking Machines Lab 對外公佈成立,Mira Murati 擔任首席執行官,Schulman 擔任首席科學家。他的個人網站將這一職務標為共同創始人兼首席科學家。[14][11]
公司將研究方向表述為,讓 AI 更易理解、能夠適應不同使用者的需求,並支持人與 AI 協作。其公開介紹強調研究與產品共同迭代,以及分享技術論文、代碼和經驗。[15]
2025年獲得伯克利校友榮譽
2025年9月發表 LoRA 微調研究
2025年9月29日,Schulman 與 Thinking Machines Lab 同事發表《LoRA Without Regret》,比較低秩適配(LoRA)和全參數微調在監督學習及強化學習中的表現。[17]
研究報告,在適配容量足夠、應用層與超參數設置合適的實驗條件下,LoRA 可接近全參數微調的樣本效率和最終表現;當數據量超過容量,或部分大批量訓練設置不合適時,也會出現性能差距。[17]
2026年9月討論 AI 自我改進與人類目標
2026年9月,Schulman 與 Beren MillidgeBeren MillidgeBeren Millidge 是人工智能研究者,AI 實驗室 Zyphra 的聯合創始人,個人簡歷所列職務為聯合創始人兼首席科學家,2026年9月 Dwarkesh Patel 節目介紹其為 Zyphra 首席技術官。他獲愛丁堡大學機器學習與計算神經科學博士學位,研究方向包括預測編碼,曾在牛津大學任博士後,並先後任 Conjecture 研究負責人、Apollo Research 聯合創始人。點擊查看完整詞條、Charlie O’Neill 參加 Dwarkesh Podcast 討論,分析 AI 遞歸自我改進、泛化和研究自動化的條件。他認為,模型能力提升並不必然立即轉化為同等幅度的科研生產力提升,判斷力和自我檢查能力仍可能形成瓶頸。[18]
在這場討論中,他區分了“決定應當追求什麼目標”和“優化已確定的目標”,認為前者仍需要人類持續參與。這是他對 AI 發展與對齊工作的判斷。[18]
公開賬號與關聯機構
Schulman 的個人網站為 https://joschu.net(在新窗口打開),公開 X 賬號為 @johnschulman2(https://x.com/johnschulman2(在新窗口打開))。[11][19]
Thinking Machines Lab:共同創始人兼首席科學家;OpenAI:共同創始人及曾任後訓練團隊共同負責人;Anthropic:曾在 Alignment Science 團隊從事研究。[11]
來源
- ChatGPT architect, Berkeley alum John Schulman on his journey with AI(在新窗口打開)
- Trust Region Policy Optimization(在新窗口打開)
- High-Dimensional Continuous Control Using Generalized Advantage Estimation(在新窗口打開)
- Introducing OpenAI(在新窗口打開)
- Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs(在新窗口打開)
- CS Distinguished Alumni Award Winners(在新窗口打開)
- Proximal Policy Optimization Algorithms(在新窗口打開)
- John Schulman — Innovators Under 35(在新窗口打開)
- Training language models to follow instructions with human feedback(在新窗口打開)
- Introducing ChatGPT(在新窗口打開)
- John Schulman's Homepage(在新窗口打開)
- Berkeley Talks: ChatGPT developer John Schulman on making AI more truthful(在新窗口打開)
- John Schulman:关于离开 OpenAI 加入 Anthropic 的说明(在新窗口打開)
- Former OpenAI CTO Mira Murati launches Thinking Machines Lab(在新窗口打開)
- Thinking Machines Lab(在新窗口打開)
- Berkeley Charter Gala 2025(在新窗口打開)
- LoRA Without Regret(在新窗口打開)
- AI researchers debate how close we are to recursive self-improvement(在新窗口打開)
- John Schulman (@johnschulman2)(在新窗口打開)