Neil Zeghidour
Neil Zeghidour 是从事语音与生成式音频研究的人工智能研究者、创业者,Gradium 联合创始人兼首席执行官,也是 Kyutai 创始研究团队成员。他曾在 FacebookFacebookFacebook(脸书)是 Meta 旗下的社交网络平台,2004年从哈佛校园上线,逐步发展出动态消息、照片与视频分享、群组及 Marketplace 等功能。平台保留 Facebook 名称,母公司在2021年采用 Meta 品牌;两者的用户与财务数据应按各自口径理解。点击查看完整词条 AI Research 和 GoogleGoogleGoogle是一家美国科技公司,由Larry Page与Sergey Brin创办,1998年注册成立,2015年成为Alphabet旗下企业。其业务涵盖互联网搜索、广告、软件平台、云计算及人工智能。点击查看完整词条 从事研究,参与 SoundStream、AudioLM、SoundStorm、Moshi 与 Hibiki 等音频模型的开发。
本页目录7 节
词条资料
教育与早期语音研究
Neil Zeghidour 取得巴黎多芬大学量化金融硕士、巴黎萨克雷高等师范学校机器学习硕士,以及巴黎高等师范学校机器学习博士学位。他曾在 Facebook AI Research 工作三年,研究自动语音识别和音频理解;也曾在巴黎萨克雷高等师范学校教授语音处理技术。[1]
2018年12月,他与 Qiantong Xu、Vitaliy Liptchinsky、Nicolas Usunier、Gabriel Synnaeve、Ronan Collobert 发表全卷积语音识别研究。团队从原始音频波形直接预测字符,以端到端训练替代手工特征提取,并结合卷积语言模型解码词语。[2]
2021年至2023年Google 的生成式音频工作
离开 Facebook 后,Zeghidour 在 Google 建立并领导生成式音频研究团队。该阶段工作涉及音频压缩、文本生成音乐,以及保留说话者声音特征的语音翻译。[1]
2021年,他以第一作者身份参与 SoundStream。该神经音频编解码器以编码器、解码器和残差向量量化器联合训练,在低码率下处理语音、音乐和环境声音;同一模型还能结合压缩与降噪。Google 当时计划将其技术用于后续 Lyra 版本。[3]
2022年9月,他作为共同作者参与 AudioLM 论文。该框架将音频转换为离散标记序列,再使用语言建模方法生成后续音频,结合语义结构与声学细节表示,可延续语音及钢琴音乐。论文展示的是团队模型的研究结果。[4]
2023年5月,他参与的 SoundStorm 进一步研究并行音频生成:模型接收 AudioLM 的语义标记,通过双向注意力和基于置信度的并行解码生成声学标记。论文报告,在 TPU-v4 上生成30秒音频约需0.5秒;这一速度对应论文测试环境。[5]
2023年至2025年Kyutai、Moshi 与 Hibiki
2023年11月,Kyutai 在巴黎启动,Zeghidour 是创始研究团队成员。实验室由 iliad、CMA CGM 与 Schmidt Futures 支持,以非营利和开放研究为定位,计划向研究者、开发者及企业分享成果。[6][1]
2024年,他参与 Moshi 语音对话模型研究。模型将自身语音和用户语音建模为并行流,允许系统在说话时继续接收用户声音,从而处理重叠发言、插话等对话现象;同时结合文本与音频标记,改善生成语音的语言内容。[7]
2025年2月,他与 Tom Labiausse、Laurent Mazaré、Edouard Grave、Patrick Pérez、Alexandre Défossez 发布 Hibiki 研究。该模型同步处理源语言和目标语言语音,逐步输出翻译,不必等待整句话结束;论文在法语到英语任务中评估翻译质量、声音保真度和自然度,并提供模型与推理代码。[8]
2025年创办 Gradium
2025年9月,Zeghidour 与 Olivier Teboul、Laurent Mazaré、Alexandre Défossez 创办 Gradium,由他担任首席执行官。公司以语音模型和基础设施为业务,将研究成果用于开发者与企业的实际产品;Kyutai 官网将 Gradium 称为实验室的首家衍生公司。[9][10]
12月2日,Gradium 公开推出业务,并宣布获得7000万美元种子融资,由 FirstMark Capital 和 Eurazeo 领投。上线时支持英语、法语、德语、西班牙语和葡萄牙语。Zeghidour 当日在 X 表示,希望将过去十年在 MetaMetaMeta(Meta Platforms, Inc.)是美国上市科技公司,2021年由 Facebook 公司更名而来,经营社交通信、数字广告、虚拟现实、智能眼镜及人工智能业务。点击查看完整词条、Google 和 Kyutai 积累的音频研究带入更多语音产品。[9][11]
2026年产品部署、融资与评测
2026年5月发布的 AI Engineer Europe 演讲中,Zeghidour 将 Gradium 定位为语音模型组件提供者。他指出,自然的声音并不自动带来可用的对话系统:工具调用、可靠性、可观测性和个性化仍是部署难点。他也承认,相比完全端到端的语音对话模型,语音识别、文本模型和语音合成组合而成的级联系统目前更易部署。[12][13]
7月8日,Gradium 宣布将种子融资扩展至累计1亿美元,新增投资者包括 NVIDIANVIDIANVIDIA 是美国半导体与计算技术公司,提供图形处理器、人工智能基础设施、网络互连和计算软件,在纳斯达克以 NVDA 为代码上市。点击查看完整词条,并在旧金山湾区设立办公室。公司计划用资金支持研究、产品与国际扩展;此前已推出实时翻译、端侧语音合成 Phonon 和语音代理工具 GradBot。[14]
9月,Coval 与 Gradium 联合文章回顾了一次延迟评测调整:6月3日将开头静音计入首次可听音频时间后,Gradium 的数据从171.9毫秒变为429.6毫秒,当时模型和服务基础设施均未改变。团队随后训练新模型,减少前导静音;文章报告9月9日的中位首次可听音频时间为214毫秒,并提醒测量方式调整前后的数据不能直接比较。[15]
公开账号
X:Neil Zeghidour 使用 @neilzegh,网址:https://x.com/neilzegh(在新窗口打开)。其当前简介列明 Gradium CEO 和 Kyutai 创办经历,并链接 Gradium 官网。[16]
来源
- Launch of Kyutai — Scientific Team: Neil Zeghidour(在新窗口打开)
- Fully Convolutional Speech Recognition(在新窗口打开)
- SoundStream: An End-to-End Neural Audio Codec(在新窗口打开)
- AudioLM: a Language Modeling Approach to Audio Generation(在新窗口打开)
- SoundStorm: Efficient Parallel Audio Generation(在新窗口打开)
- Kyutai Launch Press Release(在新窗口打开)
- Moshi: a speech-text foundation model for real-time dialogue(在新窗口打开)
- High-Fidelity Simultaneous Speech-To-Speech Translation(在新窗口打开)
- Gradium Launches to Redefine Voice AI(在新窗口打开)
- Kyutai — Open-science AI Lab(在新窗口打开)
- Announcing Gradium(在新窗口打开)
- Voice AI: when is the Her moment? — Neil Zeghidour(在新窗口打开)
- Voice AI: when is the Her moment? — Neil Zeghidour, CEO, Gradium AI(在新窗口打开)
- Gradium Extends Funding to $100 Million and Expands to Silicon Valley(在新窗口打开)
- How a benchmark change produced a faster TTS model(在新窗口打开)
- Neil Zeghidour (@neilzegh)(在新窗口打开)