ABAB Pedia

Tom Brown

Tom Brown 是 AnthropicAnthropicAnthropic是一家於2021年成立的人工智能研究與產品公司,開發Claude模型、助手及Claude Code等工具,並以公益公司形式運營。Dario Amodei與Daniela Amodei為共同創辦人,其研究涉及模型安全、可解釋性和可控性。點擊查看完整詞條 聯合創始人及首席算力官,曾負責 OpenAIOpenAIOpenAI是2015年創立的人工智能研究與產品機構,開發GPT系列模型、ChatGPT、Codex及開發者API,並開展圖像、語音、視頻與智能代理研究。2025年重組後,非營利的OpenAI Foundation繼續控制營利主體OpenAI Group PBC。其發展涉及大規模融資與算力合作,也伴隨治理、版權、隱私及人工智能安全爭議。點擊查看完整詞條 的 GPT-3 研究工程,參與人類反饋強化學習和大語言模型研究。

本頁目錄24 節
詞條資料

麻省理工學院學習經歷

Tom Brown 在麻省理工學院學習計算機科學,並關注其在腦與認知科學中的應用,取得工程碩士學位。⁠[1]

校方將他列為2010屆校友。⁠[2]

從初創公司工程工作起步

2009年夏天,仍在 MIT 就讀的 Brown 成為 LinkedLanguage 首名員工;返校後又進入移動廣告公司 MoPub。⁠[3]

2011年2月至11月,他在 MoPub 任創始工程師。⁠[4]

SolidStage 與 Grouper 創業

他隨後與 Michael Waxman 共同經營 Grouper,將線上匹配轉為三名朋友與另一組三名朋友線下見面的社交活動。⁠[6]

轉向人工智能研究

2015年,Brown 決定從互聯網創業轉向 AI,加入 South Park Commons。根據其本人回憶,社區中的機器學習討論和同伴支持幫助他克服重新起步的顧慮;約六個月的集中學習後,他進入 OpenAI。⁠[7]

他曾承接 Twitch 的短期合同工作,為後續自學籌措生活費用。⁠[3]

首次加入 OpenAI

2016年5月,Brown 加入 OpenAI,任職至2017年5月。⁠[4]

人類偏好與強化學習

Brown 與 Paul Christiano、Jan Leike、Dario AmodeiDario AmodeiDario Amodei 是人工智能研究人員、Anthropic 聯合創始人兼首席執行官。他接受過物理學和生物物理學訓練,曾在百度、Google Brain 與 OpenAI 從事研究,並在 OpenAI 負責包括 GPT-2、GPT-3 在內的研究工作。其職業活動涵蓋大模型開發、人工智能安全、可解釋性與公共政策。點擊查看完整詞條 等共同發表《Deep reinforcement learning from human preferences》。研究先讓人比較短片段,再學習獎勵函數並訓練智能體,在遊戲及模擬運動任務中減少直接人工反饋需求;論文也討論獎勵被鑽空子和訓練反饋不匹配的侷限。⁠[8]

Google Brain 與對抗樣本

此後,Brown 在 Google Brain 研究對抗機器學習。⁠[3]

他署名第一作者的《Adversarial Patch》展示了可打印、放入現實場景的對抗圖案:即使改變位置、角度和尺度,圖案仍可誘導圖像分類器作出攻擊者指定的錯誤判斷。這項工作揭示了視覺系統面對物理世界干擾時的脆弱性。⁠[9]

重返 OpenAI

2018年12月,Brown 重返 OpenAI,擔任 GPT-3 研究工程負責人,任職至2020年12月。⁠[4]

以人類偏好微調 GPT-2

Brown 參與利用人類偏好微調 GPT-2 的研究。團隊把人工比較得到的獎勵用於文本風格和摘要任務,也發現標註方式會改變模型行為:偏好複製原文的標註可能訓練出善於摘抄的系統,而非理想的摘要器。研究強調反饋質量和持續檢查的重要性。⁠[10]

語言模型規模規律

Brown 是《Scaling Laws for Neural Language Models》的共同作者。研究在實驗範圍內描述模型參數、數據量和計算量與預測損失之間的冪律關係,為分配訓練資源提供經驗依據;這些關係依賴其他資源未成為瓶頸等條件。⁠[11]

GPT-3 與少樣本學習

Brown 在《Language Models are Few-Shot Learners》中列名第一,並與多位作者標註同等貢獻。論文研究1750億參數的 GPT-3,通過提示中的任務說明和示例完成多種任務,無須為每個任務更新模型權重。它同時記錄重複、不連貫、事實錯誤、偏見及推理成本等限制。⁠[12]

共同創辦 Anthropic

2021年1月,Brown 共同創辦 Anthropic。⁠[4]

公司5月宣佈完成1.24億美元融資,將可靠、可解釋、可控制的通用 AI 系統作為研究方向。⁠[13]

Brown 後來擔任首席算力官,領導獲取、擴展和有效使用算力的組織,支持前沿模型開發、部署、實驗及安全研究。⁠[1]

有用且無害的助手研究

Brown 參與的研究把人類反饋強化學習用於提高助手的有用性和無害性,結合偏好模型、紅隊測試與反覆訓練。工作顯示行為對齊和部分能力提升可以同時出現,但有用性與拒絕有害請求之間仍需權衡。⁠[14]

Constitutional AI

Brown 是《Constitutional AI: Harmlessness from AI Feedback》的共同作者。該方法讓模型依據一組原則批評和修訂回答,再利用 AI 產生的偏好反饋訓練模型,以減少對逐項人工無害性標註的依賴;原則的選擇仍由人參與。⁠[15]

AWS 與 Trainium 合作

隨著 Anthropic 的算力需求擴大,公司把 AWS 作為主要雲服務和訓練夥伴,雙方合作優化 Trainium 芯片及軟件,包括底層內核和 Neuron 編譯工具。這成為 Brown 所負責算力體系的一部分。⁠[16]

算力供給與多種硬件路線

在 Y Combinator 訪談中,Brown 認為不同工作負載和供給條件適合不同芯片;同時使用 GPU、TPU、Trainium 能擴大可用算力,也增加工程複雜度。他還把電力視為擴張約束,支持核能與可再生能源。⁠[3]

SpaceX 算力協議

AMD 合作與未來部署計劃

歌詞版權訴訟中的內部記錄

音樂出版商7月22日對 Anthropic 提交的修訂起訴書稱,Brown 曾於2023年2月5日要求尚未公開的 Claude 輸出 Bob Dylan 歌詞,並以此支持關於侵權及內部知情的主張。文件列被告為 Anthropic,這些內容屬於原告指控。⁠[19]

Anthropic 主張模型訓練屬於合理使用。⁠[20]

據9月16日的案件報道,早期歌詞案仍處於雙方提出簡易判決動議的階段。⁠[21]

參加 G20 創新部長級會議

9月2日,白宮公佈 G20 創新部長級會議成果,列明 Brown 與美國商務部長 Howard Lutnick 參加爐邊談話。該會議圍繞 AI、創新和跨國技術合作展開。⁠[22]

OpenAI 書籍訓練數據爭議

在針對 OpenAI 的版權訴訟中,作者原告9月17日提交的事實陳述引用內部記錄,稱 Brown 曾支持擴大 LibGen 非虛構書籍數據、將其用於訓練,並參與討論該數據來源的可疑性。這是原告對其在 OpenAI 任職期間行為的陳述,尚非法院認定。⁠[23]

OpenAI 在同案答辯中主張,預訓練是轉換性使用,目的在於學習語言統計規律,並未對相關書籍市場造成可認定的損害。⁠[24]

作者協會9月21日表示,書面辯論仍將繼續,預計2027年初舉行聽證。⁠[25]

信任、安全與創新觀點

關聯機構、網站與公開賬號

麻省理工學院:官網:https://www.mit.edu/(在新窗口打開)。⁠[27]

Brown 的公開個人賬號包括 X:https://x.com/NotTomBrown(在新窗口打開)。⁠[32]

來源

  1. Leadership at Anthropic(在新窗口打開)
  2. Tom Brown ’10 — MIT News / Forbes press clip(在新窗口打開)
  3. Anthropic Co-Founder: Building Claude Code, Lessons From GPT-3 & LLM System Design(在新窗口打開)
  4. Tom Brown — LinkedIn(在新窗口打開)
  5. SolidStage(在新窗口打開)
  6. Grouper(在新窗口打開)
  7. How I made the switch to AI research(在新窗口打開)
  8. Deep reinforcement learning from human preferences(在新窗口打開)
  9. Adversarial Patch(在新窗口打開)
  10. Fine-tuning GPT-2 from human preferences(在新窗口打開)
  11. Scaling Laws for Neural Language Models(在新窗口打開)
  12. Language Models are Few-Shot Learners(在新窗口打開)
  13. Anthropic raises $124 million to build more reliable, general AI systems(在新窗口打開)
  14. Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback(在新窗口打開)
  15. Constitutional AI: Harmlessness from AI Feedback(在新窗口打開)
  16. Anthropic and AWS deepen their work together(在新窗口打開)
  17. Higher usage limits for Claude and a compute deal with SpaceX(在新窗口打開)
  18. AMD and Anthropic Announce Strategic Partnership to Deploy up to 2 Gigawatts of AMD Instinct MI450 Series GPUs(在新窗口打開)
  19. Concord Music Group, Inc. et al. v. Anthropic PBC — Second Amended Complaint(在新窗口打開)
  20. Music publishers file amended lyrics lawsuit against Anthropic(在新窗口打開)
  21. Anthropic bought songbooks, scanned them, and destroyed them, music publishers allege. Now they want to know which songs were in them.(在新窗口打開)
  22. G20 Innovation Ministerial Concludes with Consensus Statement(在新窗口打開)
  23. Class Plaintiffs’ Corrected Rule 56.1 Statement of Undisputed Material Facts(在新窗口打開)
  24. OpenAI’s Memorandum of Points and Authorities in Support of Motion for Summary Judgment(在新窗口打開)
  25. OpenAI Top Executives Knew Mass Book Piracy Was Illegal, New Filings Show(在新窗口打開)
  26. Tom Brown on trust, safety and innovation(在新窗口打開)
  27. 麻省理工学院官方网站(在新窗口打開)
  28. Y Combinator(在新窗口打開)
  29. South Park Commons(在新窗口打開)
  30. OpenAI(在新窗口打開)
  31. Google Research(在新窗口打開)
  32. Tom Brown (@NotTomBrown)(在新窗口打開)