ABAB Pedia

Neil Zeghidour

Neil Zeghidour 是從事語音與生成式音頻研究的人工智能研究者、創業者,Gradium 聯合創始人兼首席執行官,也是 Kyutai 創始研究團隊成員。他曾在 FacebookFacebookFacebook(臉書)是 Meta 旗下的社交網絡平臺,2004年從哈佛校園上線,逐步發展出動態消息、照片與視頻分享、群組及 Marketplace 等功能。平臺保留 Facebook 名稱,母公司在2021年採用 Meta 品牌;兩者的用戶與財務數據應按各自口徑理解。點擊查看完整詞條 AI Research 和 GoogleGoogleGoogle是一家美國科技公司,由Larry Page與Sergey Brin創辦,1998年註冊成立,2015年成為Alphabet旗下企業。其業務涵蓋互聯網搜索、廣告、軟件平臺、雲計算及人工智能。點擊查看完整詞條 從事研究,參與 SoundStream、AudioLM、SoundStorm、Moshi 與 Hibiki 等音頻模型的開發。

本頁目錄7 節
詞條資料

教育與早期語音研究

Neil Zeghidour 取得巴黎多芬大學量化金融碩士、巴黎薩克雷高等師範學校機器學習碩士,以及巴黎高等師範學校機器學習博士學位。他曾在 Facebook AI Research 工作三年,研究自動語音識別和音頻理解;也曾在巴黎薩克雷高等師範學校教授語音處理技術。⁠[1]

2018年12月,他與 Qiantong Xu、Vitaliy Liptchinsky、Nicolas Usunier、Gabriel Synnaeve、Ronan Collobert 發表全卷積語音識別研究。團隊從原始音頻波形直接預測字符,以端到端訓練替代手工特徵提取,並結合卷積語言模型解碼詞語。⁠[2]

Google 的生成式音頻工作

離開 Facebook 後,Zeghidour 在 Google 建立並領導生成式音頻研究團隊。該階段工作涉及音頻壓縮、文本生成音樂,以及保留說話者聲音特徵的語音翻譯。⁠[1]

2021年,他以第一作者身份參與 SoundStream。該神經音頻編解碼器以編碼器、解碼器和殘差向量量化器聯合訓練,在低碼率下處理語音、音樂和環境聲音;同一模型還能結合壓縮與降噪。Google 當時計劃將其技術用於後續 Lyra 版本。⁠[3]

2022年9月,他作為共同作者參與 AudioLM 論文。該框架將音頻轉換為離散標記序列,再使用語言建模方法生成後續音頻,結合語義結構與聲學細節表示,可延續語音及鋼琴音樂。論文展示的是團隊模型的研究結果。⁠[4]

2023年5月,他參與的 SoundStorm 進一步研究並行音頻生成:模型接收 AudioLM 的語義標記,通過雙向注意力和基於置信度的並行解碼生成聲學標記。論文報告,在 TPU-v4 上生成30秒音頻約需0.5秒;這一速度對應論文測試環境。⁠[5]

Kyutai、Moshi 與 Hibiki

2023年11月,Kyutai 在巴黎啟動,Zeghidour 是創始研究團隊成員。實驗室由 iliad、CMA CGM 與 Schmidt Futures 支持,以非營利和開放研究為定位,計劃向研究者、開發者及企業分享成果。⁠[6][1]

2024年,他參與 Moshi 語音對話模型研究。模型將自身語音和用戶語音建模為並行流,允許系統在說話時繼續接收用戶聲音,從而處理重疊發言、插話等對話現象;同時結合文本與音頻標記,改善生成語音的語言內容。⁠[7]

2025年2月,他與 Tom Labiausse、Laurent Mazaré、Edouard Grave、Patrick Pérez、Alexandre Défossez 發佈 Hibiki 研究。該模型同步處理源語言和目標語言語音,逐步輸出翻譯,不必等待整句話結束;論文在法語到英語任務中評估翻譯質量、聲音保真度和自然度,並提供模型與推理代碼。⁠[8]

創辦 Gradium

2025年9月,Zeghidour 與 Olivier Teboul、Laurent Mazaré、Alexandre Défossez 創辦 Gradium,由他擔任首席執行官。公司以語音模型和基礎設施為業務,將研究成果用於開發者與企業的實際產品;Kyutai 官網將 Gradium 稱為實驗室的首家衍生公司。⁠[9][10]

12月2日,Gradium 公開推出業務,並宣佈獲得7000萬美元種子融資,由 FirstMark Capital 和 Eurazeo 領投。上線時支持英語、法語、德語、西班牙語和葡萄牙語。Zeghidour 當日在 X 表示,希望將過去十年在 MetaMetaMeta(Meta Platforms, Inc.)是美國上市科技公司,2021年由 Facebook 公司更名而來,經營社交通信、數字廣告、虛擬現實、智能眼鏡及人工智能業務。點擊查看完整詞條、Google 和 Kyutai 積累的音頻研究帶入更多語音產品。⁠[9][11]

產品部署、融資與評測

2026年5月發佈的 AI Engineer Europe 演講中,Zeghidour 將 Gradium 定位為語音模型組件提供者。他指出,自然的聲音並不自動帶來可用的對話系統:工具調用、可靠性、可觀測性和個性化仍是部署難點。他也承認,相比完全端到端的語音對話模型,語音識別、文本模型和語音合成組合而成的級聯繫統目前更易部署。⁠[12][13]

7月8日,Gradium 宣佈將種子融資擴展至累計1億美元,新增投資者包括 NVIDIANVIDIANVIDIA 是美國半導體與計算技術公司,提供圖形處理器、人工智能基礎設施、網絡互連和計算軟件,在納斯達克以 NVDA 為代碼上市。點擊查看完整詞條,並在舊金山灣區設立辦公室。公司計劃用資金支持研究、產品與國際擴展;此前已推出實時翻譯、端側語音合成 Phonon 和語音代理工具 GradBot。⁠[14]

9月,Coval 與 Gradium 聯合文章回顧了一次延遲評測調整:6月3日將開頭靜音計入首次可聽音頻時間後,Gradium 的數據從171.9毫秒變為429.6毫秒,當時模型和服務基礎設施均未改變。團隊隨後訓練新模型,減少前導靜音;文章報告9月9日的中位首次可聽音頻時間為214毫秒,並提醒測量方式調整前後的數據不能直接比較。⁠[15]

公開賬號

X:Neil Zeghidour 使用 @neilzegh,網址:https://x.com/neilzegh(在新窗口打開)。其當前簡介列明 Gradium CEO 和 Kyutai 創辦經歷,並鏈接 Gradium 官網。⁠[16]

來源

  1. Launch of Kyutai — Scientific Team: Neil Zeghidour(在新窗口打開)
  2. Fully Convolutional Speech Recognition(在新窗口打開)
  3. SoundStream: An End-to-End Neural Audio Codec(在新窗口打開)
  4. AudioLM: a Language Modeling Approach to Audio Generation(在新窗口打開)
  5. SoundStorm: Efficient Parallel Audio Generation(在新窗口打開)
  6. Kyutai Launch Press Release(在新窗口打開)
  7. Moshi: a speech-text foundation model for real-time dialogue(在新窗口打開)
  8. High-Fidelity Simultaneous Speech-To-Speech Translation(在新窗口打開)
  9. Gradium Launches to Redefine Voice AI(在新窗口打開)
  10. Kyutai — Open-science AI Lab(在新窗口打開)
  11. Announcing Gradium(在新窗口打開)
  12. Voice AI: when is the Her moment? — Neil Zeghidour(在新窗口打開)
  13. Voice AI: when is the Her moment? — Neil Zeghidour, CEO, Gradium AI(在新窗口打開)
  14. Gradium Extends Funding to $100 Million and Expands to Silicon Valley(在新窗口打開)
  15. How a benchmark change produced a faster TTS model(在新窗口打開)
  16. Neil Zeghidour (@neilzegh)(在新窗口打開)