Neil Zeghidour
Neil Zeghidour 是从事语音与生成式音频研究的人工智能研究者、创业者,Gradium 联合创始人兼首席执行官,也是 Kyutai 创始研究团队成员。他曾在 Facebook AI Research 和 Google 从事研究,参与 SoundStream、AudioLM、SoundStorm、Moshi 与 Hibiki 等音频模型的开发。
本页目录7 节
词条资料
教育与早期语音研究
Neil Zeghidour 取得巴黎多芬大学量化金融硕士、巴黎萨克雷高等师范学校机器学习硕士,以及巴黎高等师范学校机器学习博士学位。他曾在 Facebook AI Research 工作三年,研究自动语音识别和音频理解;也曾在巴黎萨克雷高等师范学校教授语音处理技术。[1]
2018年12月,他与 Qiantong Xu、Vitaliy Liptchinsky、Nicolas Usunier、Gabriel Synnaeve、Ronan Collobert 发表全卷积语音识别研究。团队从原始音频波形直接预测字符,以端到端训练替代手工特征提取,并结合卷积语言模型解码词语。[2]
2021年至2023年Google 的生成式音频工作
离开 Facebook 后,Zeghidour 在 Google 建立并领导生成式音频研究团队。该阶段工作涉及音频压缩、文本生成音乐,以及保留说话者声音特征的语音翻译。[1]
2021年,他以第一作者身份参与 SoundStream。该神经音频编解码器以编码器、解码器和残差向量量化器联合训练,在低码率下处理语音、音乐和环境声音;同一模型还能结合压缩与降噪。Google 当时计划将其技术用于后续 Lyra 版本。[3]
2022年9月,他作为共同作者参与 AudioLM 论文。该框架将音频转换为离散标记序列,再使用语言建模方法生成后续音频,结合语义结构与声学细节表示,可延续语音及钢琴音乐。论文展示的是团队模型的研究结果。[4]
2023年5月,他参与的 SoundStorm 进一步研究并行音频生成:模型接收 AudioLM 的语义标记,通过双向注意力和基于置信度的并行解码生成声学标记。论文报告,在 TPU-v4 上生成30秒音频约需0.5秒;这一速度对应论文测试环境。[5]
2023年至2025年Kyutai、Moshi 与 Hibiki
2023年11月,Kyutai 在巴黎启动,Zeghidour 是创始研究团队成员。实验室由 iliad、CMA CGM 与 Schmidt Futures 支持,以非营利和开放研究为定位,计划向研究者、开发者及企业分享成果。[6][1]
2024年,他参与 Moshi 语音对话模型研究。模型将自身语音和用户语音建模为并行流,允许系统在说话时继续接收用户声音,从而处理重叠发言、插话等对话现象;同时结合文本与音频标记,改善生成语音的语言内容。[7]
2025年2月,他与 Tom Labiausse、Laurent Mazaré、Edouard Grave、Patrick Pérez、Alexandre Défossez 发布 Hibiki 研究。该模型同步处理源语言和目标语言语音,逐步输出翻译,不必等待整句话结束;论文在法语到英语任务中评估翻译质量、声音保真度和自然度,并提供模型与推理代码。[8]
2025年创办 Gradium
2026年产品部署、融资与评测
2026年5月发布的 AI Engineer Europe 演讲中,Zeghidour 将 Gradium 定位为语音模型组件提供者。他指出,自然的声音并不自动带来可用的对话系统:工具调用、可靠性、可观测性和个性化仍是部署难点。他也承认,相比完全端到端的语音对话模型,语音识别、文本模型和语音合成组合而成的级联系统目前更易部署。[12][13]
7月8日,Gradium 宣布将种子融资扩展至累计1亿美元,新增投资者包括 NVIDIA,并在旧金山湾区设立办公室。公司计划用资金支持研究、产品与国际扩展;此前已推出实时翻译、端侧语音合成 Phonon 和语音代理工具 GradBot。[14]
9月,Coval 与 Gradium 联合文章回顾了一次延迟评测调整:6月3日将开头静音计入首次可听音频时间后,Gradium 的数据从171.9毫秒变为429.6毫秒,当时模型和服务基础设施均未改变。团队随后训练新模型,减少前导静音;文章报告9月9日的中位首次可听音频时间为214毫秒,并提醒测量方式调整前后的数据不能直接比较。[15]
公开账号
X:Neil Zeghidour 使用 @neilzegh,网址:https://x.com/neilzegh(在新窗口打开)。其当前简介列明 Gradium CEO 和 Kyutai 创办经历,并链接 Gradium 官网。[16]
来源
- Launch of Kyutai — Scientific Team: Neil Zeghidour(在新窗口打开)
- Fully Convolutional Speech Recognition(在新窗口打开)
- SoundStream: An End-to-End Neural Audio Codec(在新窗口打开)
- AudioLM: a Language Modeling Approach to Audio Generation(在新窗口打开)
- SoundStorm: Efficient Parallel Audio Generation(在新窗口打开)
- Kyutai Launch Press Release(在新窗口打开)
- Moshi: a speech-text foundation model for real-time dialogue(在新窗口打开)
- High-Fidelity Simultaneous Speech-To-Speech Translation(在新窗口打开)
- Gradium Launches to Redefine Voice AI(在新窗口打开)
- Kyutai — Open-science AI Lab(在新窗口打开)
- Announcing Gradium(在新窗口打开)
- Voice AI: when is the Her moment? — Neil Zeghidour(在新窗口打开)
- Voice AI: when is the Her moment? — Neil Zeghidour, CEO, Gradium AI(在新窗口打开)
- Gradium Extends Funding to $100 Million and Expands to Silicon Valley(在新窗口打开)
- How a benchmark change produced a faster TTS model(在新窗口打开)
- Neil Zeghidour (@neilzegh)(在新窗口打开)