ABAB Pedia

Sayak Paul

Sayak Paul 是機器學習工程師、應用研究者及開源軟件貢獻者,現任Hugging Face高級研究工程師,參與Diffusers的維護與圖像、視頻生成模型研究。他曾在TCS、DataCamp、PyImageSearch和Carted工作,研究涉及視覺模型魯棒性、參數高效微調及擴散模型推理優化,並長期撰寫技術文章、參與開發者教學與社區活動。

本頁目錄8 節
詞條資料

教育與早期工程工作

Paul於2013年至2017年就讀Netaji Subhash Engineering College,取得信息技術專業B.Tech學位,畢業課題涉及結合特徵選擇與深度神經網絡的入侵檢測系統。⁠[1]

畢業後,他於2017年7月加入Tata Consultancy Services擔任軟件工程師,2018年轉至TCS Research and Innovation;同年8月開始以合同講師身份在DataCamp從事數據科學教學,至2019年6月。⁠[2]

2019—2021年:計算機視覺與社區貢獻

2019年6月至2021年6月,他在PyImageSearch擔任深度學習工程崗位,並參與開源工具、技術教學和社區活動。他曾共同組織GDG Kolkata及TensorFlow User Group Kolkata。⁠[2][3]

據其公開經歷,他從2019年起參與Google Developer Expert和創業加速器導師項目,並於2020、2021和2022年獲得Google Open Source Peer Bonus。他也曾在TensorFlow的Google Summer of Code項目中指導學生。⁠[3]

2021年5月,Paul與Pin-Yu Chen發表《Vision Transformers are Robust Learners》預印本,比較視覺Transformer與卷積網絡面對圖像損壞、分佈變化等情況時的魯棒性。論文註明兩人共同貢獻,並獲AAAI 2022接收。⁠[4]

2021—2022年:Carted與模型部署

2021年6月,他加入電商技術公司Carted,擔任創始團隊機器學習工程師,至2022年10月。在其與同事合作的工程文章中,團隊介紹了商品分類模型的訓練、壓縮和在線部署。⁠[2][5]

2022年9月發佈的報告記錄了優化過程中的失敗嘗試:直接量化造成明顯精度損失,剪枝方案在真實的短商品標題上也未獲得預期速度收益。團隊隨後結合知識蒸餾、量化與ONNX部署,在其測試條件下取得較好的速度與準確率平衡。⁠[5]

2022—2023年:加入Hugging Face

2022年10月,Paul加入Hugging Face擔任開發者倡導工程師,2023年7月轉為機器學習工程師。他參與Diffusers開源庫的功能開發和維護,工作逐漸聚焦圖像及視頻生成。⁠[2]

2023年2月,他與Sourab Mangrulkar共同發表PEFT庫介紹,說明如何通過只訓練部分參數降低大型模型微調的計算與存儲成本,並展示其與Transformers、Accelerate的集成方式。⁠[6]

同年10月,他參加GoogleGoogleGoogle是一家美國科技公司,由Larry Page與Sergey Brin創辦,1998年註冊成立,2015年成為Alphabet旗下企業。其業務涵蓋互聯網搜索、廣告、軟件平臺、雲計算及人工智能。點擊查看完整詞條的People of AI節目,圍繞社區貢獻如何幫助自己進入Hugging Face、機器學習入門資源、擴散模型發展與負責任AI等主題展開交流。⁠[7]

擴散模型研究與公開教學

2025年4月,他參與發表ReflectionFlow研究,探索在生成圖像後提供具體反饋,再通過推理階段的迭代修正改善複雜場景與細節表現。該研究結合噪聲、提示詞和反思反饋三個方向擴展生成過程。⁠[8]

2025年,他在斯坦福大學CS25課程介紹擴散Transformer及圖像生成,並於7月公開分享錄影與幻燈片;所分享的課件標明講授時間為當年5月。⁠[9]

推理優化與生成評測

2026年3月起,Paul的個人履歷列為Hugging Face高級研究工程師,工作包括Diffusers維護、模型訓練與推理性能優化,也參與Kernels項目。⁠[2]

6月,他與同事發表Beyond LoRA,比較不同參數高效微調技術的準確率、顯存、運行時間等指標。文章強調應根據任務和硬件權衡選擇方法,並說明超參數覆蓋與基準範圍的侷限。⁠[10]

8月,他參與PAWBench預印本,研究視頻生成模型能否在重複採樣時還原物理過程的多種可能結果及其概率分佈。論文提出相應評測協議,並報告所測系統在分佈層面仍存在差距。⁠[11]

9月,他公開介紹QwenImage 2.1中緩存固定上下文以減少重複計算的方法,並分享自己在Google AI Systems DevLabs介紹Diffusers通過PyTorch/XLA運行於TPU的經歷。⁠[12][13]

關聯機構、網站與公開賬號

Hugging Face:其任職機構,官網為 https://huggingface.co/(在新窗口打開) 。Diffusers項目位於 https://github.com/huggingface/diffusers(在新窗口打開) 。⁠[2]

Netaji Subhash Engineering College:其畢業院校,官網為 https://www.nsec.ac.in/(在新窗口打開) 。⁠[1]

Carted:其原任職公司,官網為 https://www.carted.com/(在新窗口打開) ,工程文章保存在該站博客。⁠[2][5]

來源

  1. Education — Sayak Paul(在新窗口打開)
  2. About Me — Sayak Paul(在新窗口打開)
  3. Mentorship, Awards and Recognition(在新窗口打開)
  4. Vision Transformers are Robust Learners(在新窗口打開)
  5. Building an Efficient Machine Learning API(在新窗口打開)
  6. PEFT: Parameter-Efficient Fine-Tuning of Billion-Scale Models on Low-Resource Hardware(在新窗口打開)
  7. Sayak Paul — Getting started with community contributions, diffusion models, and more(在新窗口打開)
  8. From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning(在新窗口打開)
  9. Stanford CS25 — Diffusion Transformers presentation(在新窗口打開)
  10. Beyond LoRA: Can you beat the most popular fine-tuning technique?(在新窗口打開)
  11. PAWBench: How Far Are We from Probabilistically Aligned World Modeling?(在新窗口打開)
  12. QwenImage 2.1 KV Caching — technical thread(在新窗口打開)
  13. AI Systems DevLabs — PyTorch/XLA与Diffusers(在新窗口打開)
  14. Sayak Paul — Personal Website(在新窗口打開)
  15. Sayak Paul (@RisingSayak)(在新窗口打開)