ABAB Pedia

Neil Zeghidour

Neil Zeghidour 是从事语音与生成式音频研究的人工智能研究者、创业者,Gradium 联合创始人兼首席执行官,也是 Kyutai 创始研究团队成员。他曾在 Facebook AI Research 和 Google 从事研究,参与 SoundStream、AudioLM、SoundStorm、Moshi 与 Hibiki 等音频模型的开发。

本页目录7
词条资料

教育与早期语音研究

Neil Zeghidour 取得巴黎多芬大学量化金融硕士、巴黎萨克雷高等师范学校机器学习硕士,以及巴黎高等师范学校机器学习博士学位。他曾在 Facebook AI Research 工作三年,研究自动语音识别和音频理解;也曾在巴黎萨克雷高等师范学校教授语音处理技术。[1]

2018年12月,他与 Qiantong Xu、Vitaliy Liptchinsky、Nicolas Usunier、Gabriel Synnaeve、Ronan Collobert 发表全卷积语音识别研究。团队从原始音频波形直接预测字符,以端到端训练替代手工特征提取,并结合卷积语言模型解码词语。[2]

Google 的生成式音频工作

离开 Facebook 后,Zeghidour 在 Google 建立并领导生成式音频研究团队。该阶段工作涉及音频压缩、文本生成音乐,以及保留说话者声音特征的语音翻译。[1]

2021年,他以第一作者身份参与 SoundStream。该神经音频编解码器以编码器、解码器和残差向量量化器联合训练,在低码率下处理语音、音乐和环境声音;同一模型还能结合压缩与降噪。Google 当时计划将其技术用于后续 Lyra 版本。[3]

2022年9月,他作为共同作者参与 AudioLM 论文。该框架将音频转换为离散标记序列,再使用语言建模方法生成后续音频,结合语义结构与声学细节表示,可延续语音及钢琴音乐。论文展示的是团队模型的研究结果。[4]

2023年5月,他参与的 SoundStorm 进一步研究并行音频生成:模型接收 AudioLM 的语义标记,通过双向注意力和基于置信度的并行解码生成声学标记。论文报告,在 TPU-v4 上生成30秒音频约需0.5秒;这一速度对应论文测试环境。[5]

Kyutai、Moshi 与 Hibiki

2023年11月,Kyutai 在巴黎启动,Zeghidour 是创始研究团队成员。实验室由 iliad、CMA CGM 与 Schmidt Futures 支持,以非营利和开放研究为定位,计划向研究者、开发者及企业分享成果。[6][1]

2024年,他参与 Moshi 语音对话模型研究。模型将自身语音和用户语音建模为并行流,允许系统在说话时继续接收用户声音,从而处理重叠发言、插话等对话现象;同时结合文本与音频标记,改善生成语音的语言内容。[7]

2025年2月,他与 Tom Labiausse、Laurent Mazaré、Edouard Grave、Patrick Pérez、Alexandre Défossez 发布 Hibiki 研究。该模型同步处理源语言和目标语言语音,逐步输出翻译,不必等待整句话结束;论文在法语到英语任务中评估翻译质量、声音保真度和自然度,并提供模型与推理代码。[8]

创办 Gradium

2025年9月,Zeghidour 与 Olivier Teboul、Laurent Mazaré、Alexandre Défossez 创办 Gradium,由他担任首席执行官。公司以语音模型和基础设施为业务,将研究成果用于开发者与企业的实际产品;Kyutai 官网将 Gradium 称为实验室的首家衍生公司。[9][10]

12月2日,Gradium 公开推出业务,并宣布获得7000万美元种子融资,由 FirstMark Capital 和 Eurazeo 领投。上线时支持英语、法语、德语、西班牙语和葡萄牙语。Zeghidour 当日在 X 表示,希望将过去十年在 Meta、Google 和 Kyutai 积累的音频研究带入更多语音产品。[9][11]

产品部署、融资与评测

2026年5月发布的 AI Engineer Europe 演讲中,Zeghidour 将 Gradium 定位为语音模型组件提供者。他指出,自然的声音并不自动带来可用的对话系统:工具调用、可靠性、可观测性和个性化仍是部署难点。他也承认,相比完全端到端的语音对话模型,语音识别、文本模型和语音合成组合而成的级联系统目前更易部署。[12][13]

7月8日,Gradium 宣布将种子融资扩展至累计1亿美元,新增投资者包括 NVIDIA,并在旧金山湾区设立办公室。公司计划用资金支持研究、产品与国际扩展;此前已推出实时翻译、端侧语音合成 Phonon 和语音代理工具 GradBot。[14]

9月,Coval 与 Gradium 联合文章回顾了一次延迟评测调整:6月3日将开头静音计入首次可听音频时间后,Gradium 的数据从171.9毫秒变为429.6毫秒,当时模型和服务基础设施均未改变。团队随后训练新模型,减少前导静音;文章报告9月9日的中位首次可听音频时间为214毫秒,并提醒测量方式调整前后的数据不能直接比较。[15]

公开账号

X:Neil Zeghidour 使用 @neilzegh,网址:https://x.com/neilzegh(在新窗口打开)。其当前简介列明 Gradium CEO 和 Kyutai 创办经历,并链接 Gradium 官网。[16]

来源

  1. Launch of Kyutai — Scientific Team: Neil Zeghidour(在新窗口打开)
  2. Fully Convolutional Speech Recognition(在新窗口打开)
  3. SoundStream: An End-to-End Neural Audio Codec(在新窗口打开)
  4. AudioLM: a Language Modeling Approach to Audio Generation(在新窗口打开)
  5. SoundStorm: Efficient Parallel Audio Generation(在新窗口打开)
  6. Kyutai Launch Press Release(在新窗口打开)
  7. Moshi: a speech-text foundation model for real-time dialogue(在新窗口打开)
  8. High-Fidelity Simultaneous Speech-To-Speech Translation(在新窗口打开)
  9. Gradium Launches to Redefine Voice AI(在新窗口打开)
  10. Kyutai — Open-science AI Lab(在新窗口打开)
  11. Announcing Gradium(在新窗口打开)
  12. Voice AI: when is the Her moment? — Neil Zeghidour(在新窗口打开)
  13. Voice AI: when is the Her moment? — Neil Zeghidour, CEO, Gradium AI(在新窗口打开)
  14. Gradium Extends Funding to $100 Million and Expands to Silicon Valley(在新窗口打开)
  15. How a benchmark change produced a faster TTS model(在新窗口打开)
  16. Neil Zeghidour (@neilzegh)(在新窗口打开)