Sayak Paul
Sayak Paul 是机器学习工程师、应用研究者及开源软件贡献者,现任Hugging Face高级研究工程师,参与Diffusers的维护与图像、视频生成模型研究。他曾在TCS、DataCamp、PyImageSearch和Carted工作,研究涉及视觉模型鲁棒性、参数高效微调及扩散模型推理优化,并长期撰写技术文章、参与开发者教学与社区活动。
本页目录8 节
词条资料
教育与早期工程工作
Paul于2013年至2017年就读Netaji Subhash Engineering College,取得信息技术专业B.Tech学位,毕业课题涉及结合特征选择与深度神经网络的入侵检测系统。[1]
毕业后,他于2017年7月加入Tata Consultancy Services担任软件工程师,2018年转至TCS Research and Innovation;同年8月开始以合同讲师身份在DataCamp从事数据科学教学,至2019年6月。[2]
2019—2021年:计算机视觉与社区贡献
2019年6月至2021年6月,他在PyImageSearch担任深度学习工程岗位,并参与开源工具、技术教学和社区活动。他曾共同组织GDG Kolkata及TensorFlow User Group Kolkata。[2][3]
据其公开经历,他从2019年起参与Google Developer Expert和创业加速器导师项目,并于2020、2021和2022年获得Google Open Source Peer Bonus。他也曾在TensorFlow的Google Summer of Code项目中指导学生。[3]
2021年5月,Paul与Pin-Yu Chen发表《Vision Transformers are Robust Learners》预印本,比较视觉Transformer与卷积网络面对图像损坏、分布变化等情况时的鲁棒性。论文注明两人共同贡献,并获AAAI 2022接收。[4]
2021—2022年:Carted与模型部署
2022年9月发布的报告记录了优化过程中的失败尝试:直接量化造成明显精度损失,剪枝方案在真实的短商品标题上也未获得预期速度收益。团队随后结合知识蒸馏、量化与ONNX部署,在其测试条件下取得较好的速度与准确率平衡。[5]
2022—2023年:加入Hugging Face
2022年10月,Paul加入Hugging Face担任开发者倡导工程师,2023年7月转为机器学习工程师。他参与Diffusers开源库的功能开发和维护,工作逐渐聚焦图像及视频生成。[2]
2023年2月,他与Sourab Mangrulkar共同发表PEFT库介绍,说明如何通过只训练部分参数降低大型模型微调的计算与存储成本,并展示其与Transformers、Accelerate的集成方式。[6]
同年10月,他参加Google的People of AI节目,围绕社区贡献如何帮助自己进入Hugging Face、机器学习入门资源、扩散模型发展与负责任AI等主题展开交流。[7]
2025年扩散模型研究与公开教学
2025年4月,他参与发表ReflectionFlow研究,探索在生成图像后提供具体反馈,再通过推理阶段的迭代修正改善复杂场景与细节表现。该研究结合噪声、提示词和反思反馈三个方向扩展生成过程。[8]
2025年,他在斯坦福大学CS25课程介绍扩散Transformer及图像生成,并于7月公开分享录影与幻灯片;所分享的课件标明讲授时间为当年5月。[9]
2026年推理优化与生成评测
2026年3月起,Paul的个人履历列为Hugging Face高级研究工程师,工作包括Diffusers维护、模型训练与推理性能优化,也参与Kernels项目。[2]
6月,他与同事发表Beyond LoRA,比较不同参数高效微调技术的准确率、显存、运行时间等指标。文章强调应根据任务和硬件权衡选择方法,并说明超参数覆盖与基准范围的局限。[10]
8月,他参与PAWBench预印本,研究视频生成模型能否在重复采样时还原物理过程的多种可能结果及其概率分布。论文提出相应评测协议,并报告所测系统在分布层面仍存在差距。[11]
关联机构、网站与公开账号
Hugging Face:其任职机构,官网为 https://huggingface.co/(在新窗口打开) 。Diffusers项目位于 https://github.com/huggingface/diffusers(在新窗口打开) 。[2]
Netaji Subhash Engineering College:其毕业院校,官网为 https://www.nsec.ac.in/(在新窗口打开) 。[1]
Carted:其原任职公司,官网为 https://www.carted.com/(在新窗口打开) ,工程文章保存在该站博客。[2][5]
个人网站为 https://sayak.dev/(在新窗口打开) ,GitHub账号为 https://github.com/sayakpaul(在新窗口打开) ,Hugging Face个人主页为 https://huggingface.co/sayakpaul(在新窗口打开) 。[14][2]
本人X账号为 https://x.com/RisingSayak(在新窗口打开) 。[15]
来源
- Education — Sayak Paul(在新窗口打开)
- About Me — Sayak Paul(在新窗口打开)
- Mentorship, Awards and Recognition(在新窗口打开)
- Vision Transformers are Robust Learners(在新窗口打开)
- Building an Efficient Machine Learning API(在新窗口打开)
- PEFT: Parameter-Efficient Fine-Tuning of Billion-Scale Models on Low-Resource Hardware(在新窗口打开)
- Sayak Paul — Getting started with community contributions, diffusion models, and more(在新窗口打开)
- From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning(在新窗口打开)
- Stanford CS25 — Diffusion Transformers presentation(在新窗口打开)
- Beyond LoRA: Can you beat the most popular fine-tuning technique?(在新窗口打开)
- PAWBench: How Far Are We from Probabilistically Aligned World Modeling?(在新窗口打开)
- QwenImage 2.1 KV Caching — technical thread(在新窗口打开)
- AI Systems DevLabs — PyTorch/XLA与Diffusers(在新窗口打开)
- Sayak Paul — Personal Website(在新窗口打开)
- Sayak Paul (@RisingSayak)(在新窗口打开)