ABAB Pedia

Goodfire

Goodfire 是2024年成立、總部位於舊金山的人工智能可解釋性研究公司,以公益公司形式運營。公司由 Eric Ho、Tom McGrath 和 Daniel Balsam 共同創辦,研究神經網絡內部機制,並開發 Ember、Silico 等模型解釋、調試和監測工具。

本頁目錄11 節
詞條資料

創辦與研究方向

Goodfire 由 Eric Ho、Tom McGrath 與 Daniel(Dan)Balsam 創辦。Ho 曾共同創辦人工智能招聘公司 RippleMatch;McGrath 曾在 Google DeepMindGoogle DeepMindGoogle DeepMind 是 Google 旗下的人工智能研究機構,2023年4月由2014年被 Google 收購的 DeepMind 與 Google Research 的 Brain 團隊合併而成,由 Demis Hassabis 任首席執行官。它開發了 AlphaGo、AlphaFold 和 Gemini 系列模型,Hassabis 與 John Jumper 因 AlphaFold 的蛋白質結構預測工作獲得2024年諾貝爾化學獎。點擊查看完整詞條 建立可解釋性研究團隊;Balsam 曾任 RippleMatch 創始工程師及人工智能負責人。團隊希望把神經網絡內部分析轉化為開發者可用的調試工具。⁠[1][2]

700萬美元種子輪

LightspeedLightspeed Venture PartnersLightspeed Venture Partners支持從種子輪到後期融資階段的企業。其官網區分Lightspeed Management Company(LSVP)與Lightspeed India Partners(LSIP):兩者是分別運營的投資顧問實體,美國、歐洲和以色列辦公室屬於LSVP,印度及東南亞辦公室屬於LSIP。點擊查看完整詞條 宣佈領投 Goodfire 的700萬美元種子輪。其投資說明把產品定位為研究、可視化及調整模型內部概念的基礎工具,區別於僅依賴訓練數據或提示詞改變模型輸出的方法。Menlo 的組合檔案記載其在2024年種子階段參與投資。⁠[2][1]

開放稀疏自編碼器

繼 Ember 發佈後,公司開放用於 Llama 3.1 8B 和 Llama 3.3 70B 的稀疏自編碼器(SAE)。這類解釋模型把神經網絡的複雜激活分解為較易理解的特徵,也為 Ember 的 API 和 SDK 提供特徵發現與行為調整能力。模型權重、文檔和示例面向研究者開放。⁠[3]

5000萬美元A輪

1.5億美元B輪

公司宣佈以12.5億美元估值融資1.5億美元,由 B Capital 領投,Juniper Ventures、DFJ Growth、Salesforce Ventures、Menlo、Lightspeed 等參與。公告將模型設計環境的應用分為兩類:理解並調整模型行為,以及從科學模型中提取可供研究者檢驗的知識;合作方包括 Arc Institute、Mayo Clinic 與 MicrosoftMicrosoftMicrosoft(微軟)是由 Bill Gates 和 Paul Allen 於1975年創辦、總部位於美國華盛頓州雷德蒙德的科技公司,業務涵蓋 Windows、Microsoft 365、Azure、企業軟件、人工智能、遊戲和設備。點擊查看完整詞條。⁠[5]

Silico 研究資助

Goodfire 推出研究資助計劃,向獲選的大學及非營利研究團隊提供合計價值100萬美元的 Silico 使用額度。支持方向包括人工智能安全、基礎可解釋性與對齊,以及生命科學中的可解釋性研究;這是工具使用資助,而非同額現金基金。⁠[6]

與 Baseten 合作

Goodfire 與 Baseten 宣佈 Project Beacon,計劃把前者的模型內部激活監測與後者的推理平臺結合,用於識別提示注入、敏感數據洩露、網絡濫用等風險。系統可先用小型分類器篩選,再交由模型評判或人工流程處理;客戶可配置記錄、複核、拒絕和重新路由等響應。公告中的檢測率來自公司特定評測,並不表示能消除所有風險。⁠[7]

主題:Silico 與研究工作流

Silico 是 Goodfire 的可解釋性研究代理與模型設計環境。用戶給出研究目標後,代理可規劃實驗、並行執行、監測進度並返回可檢查的結果。其工具覆蓋 SAE、探針、因果分析、模型比較和數據歸因,面向語言模型、生命科學、機器人及視覺模型;官網提供 macOS 客戶端與團隊部署接洽入口。⁠[8]

主題:公司形態與技術目標

Goodfire 總部位於舊金山,以公益公司形式運營,團隊包含來自 OpenAIOpenAIOpenAI是2015年創立的人工智能研究與產品機構,開發GPT系列模型、ChatGPT、Codex及開發者API,並開展圖像、語音、視頻與智能代理研究。2025年重組後,非營利的OpenAI Foundation繼續控制營利主體OpenAI Group PBC。其發展涉及大規模融資與算力合作,也伴隨治理、版權、隱私及人工智能安全爭議。點擊查看完整詞條、Google DeepMind 等機構的研究人員和工程師。其核心方向是機制可解釋性:研究模型內部表徵與計算過程,幫助解釋、監測和干預模型行為。理解與對齊模型是公司的研究目標,不能據此斷言現有模型已被完全解釋或實現安全保證。⁠[9][5]

官方網站與公開賬號

來源

  1. Deedy Das | Menlo Ventures(在新窗口打開)
  2. Goodfire: Building Interpretable AI(在新窗口打開)
  3. Announcing Open-Source SAEs for Llama 3.3 70B and Llama 3.1 8B(在新窗口打開)
  4. Announcing Our $50M Series A to Advance AI Interpretability Research(在新窗口打開)
  5. Understanding, Learning From, and Designing AI: Our Series B(在新窗口打開)
  6. Announcing Goodfire Research Grants(在新窗口打開)
  7. Goodfire and Baseten partner to bring frontier safety to open models(在新窗口打開)
  8. Silico — your interpretability agent(在新窗口打開)
  9. About Goodfire(在新窗口打開)
  10. Goodfire (@GoodfireAI)(在新窗口打開)
  11. Goodfire | LinkedIn(在新窗口打開)