ABAB Pedia

Databricks

Databricks 是2013年创立、总部位于美国旧金山的数据与人工智能公司,起源于加州大学伯克利分校的 Apache Spark 研究团队。公司提供结合数据工程、分析、治理、机器学习和 AI 应用开发的云平台,并参与 Spark、Delta Lake、MLflow 和 Unity Catalog 等开源项目。

本页目录9
词条资料

2013—2016年:从 Berkeley 研究团队到云服务

Databricks 的起源与加州大学伯克利分校 AMPLab 的大规模数据处理研究有关。Matei Zaharia 于2009年在攻读博士期间启动 Spark 项目;2013年,Ali Ghodsi、Ion Stoica、Matei Zaharia、Patrick Wendell、Reynold Xin、Andy Konwinski 和 Arsalan Tavakoli-Shiraji 共同创立 Databricks,将相关技术发展为面向企业的产品。[1][2][3]

早期 Databricks 为用户提供开发和部署 Spark 应用的云平台,以简化计算集群管理,并通过交互式工作区查询和可视化数据。Berkeley 对校友企业的介绍记载,公司在2014年完成3300万美元 B 轮融资并推出产品,当时由 Ion Stoica 担任首席执行官。2016年1月,原工程与产品管理负责人 Ali Ghodsi 接任 CEO。[3][2]

2018—2020年:云合作与开源工具扩展

2018年3月22日,Azure Databricks 正式商用。Microsoft 将其与 Azure 的数据与计算服务整合,当时提供虚拟网络对等连接、Power BI 的 Spark 连接器和 Azure Data Factory 等集成能力,使企业可以在 Azure 环境中运行协作式数据分析。[4]

同年,Databricks 在 Spark + AI Summit 推出 MLflow,用于管理机器学习开发过程中的实验记录、代码与数据版本、可复现运行和模型部署。[5]

2019年10月,Linux Foundation 宣布托管 Delta Lake。该项目在数据湖上增加 ACID 事务、并发读写和数据结构约束,以减少数据损坏或格式不一致造成的问题。2020年6月,MLflow 也加入 Linux Foundation。两个项目分别对应数据可靠性及模型开发管理,成为 Databricks 平台之外也可使用的开源基础组件。[6][5]

扩展到 Google Cloud

2021年2月,Google Cloud 与 Databricks 宣布合作,将 Databricks 带到 Google Cloud,并与 Cloud Storage、BigQuery、Looker、Pub/Sub 和当时的 AI Platform 连接。公告介绍了基于 Google Kubernetes Engine 的运行方式,使同一数据平台能与 Google 的存储、分析及模型服务共同工作。[7]

2023—2024年:生成式 AI 与数据格式互通

2023年7月19日,Databricks 宣布完成收购 MosaicML。后者提供大模型训练平台及 MPT 模型系列,收购的产品方向是让客户基于自有数据训练和部署定制模型,并保持对数据的控制。完成交易公告同时表示,MosaicML 产品仍可单独购买,双方将在后续推进与 Databricks Lakehouse 的结合。[8]

2024年6月,Databricks 宣布达成收购 Tabular 的协议。Tabular 由 Apache Iceberg 的原始开发者 Ryan Blue、Daniel Weeks 以及 Jason Reid 创立;交易的技术目标是改善 Iceberg 与 Delta Lake 等开放数据格式之间的兼容性。公告把 UniForm 作为近期实现互通的途径,并明确更长期的统一标准需要社区持续合作,不能把这一目标理解为两种格式已经完全合并。[9]

Neon 与事务型数据库

2025年5月14日,Neon 宣布将通过收购加入 Databricks,当日公告仍以交易完成为前提。Neon 将 PostgreSQL 的计算与存储分离,并提供数据库分支、历史状态与按需扩缩容能力,面向应用及 AI 代理的状态存储需求。此后 Neon 官网确认其已成为 Databricks 平台的一部分,并说明其技术为 Lakebase 提供基础。[10][11]

战略融资与产品组合

公告将新资金的重点列为 Lakebase、Genie 和 Unity AI Gateway:Lakebase 是无服务器 PostgreSQL 数据库,Genie 利用企业数据提供问答和操作协助,Unity AI Gateway 用于多模型治理、路由与成本控制。这一组合将原有数据分析业务进一步连接到企业 AI 应用和代理的运行需求。[12]

新加坡扩展计划

9月16日,Databricks 宣布计划在未来三年向新加坡投入超过3.5亿美元,扩大其亚太及日本区域中心,拟设立新的区域办公室并把当地员工从约250人增至500人以上。公司同时公布与 EDB、IMDA 及当地高校合作的人才计划,目标是在三年内进一步培训2万人,并安排创业加速项目于11月启动。投资额、招聘和培训人数均为公告中的未来目标。[13][14]

平台架构与公司组织

Databricks 的平台采用 lakehouse(数据湖仓)架构,把数据湖存储与数据仓库的分析和管理能力结合,用于数据工程、批量与流式处理、商业分析、机器学习和 AI 开发。Spark、Delta Lake 和 MLflow 等开源项目构成其中的重要基础;平台还提供统一治理、数据共享及面向 Python、SQL、笔记本和开发环境的工具。[15]

公司总部位于旧金山。截至2026年9月查阅,官网列 Ali Ghodsi 为 CEO、Ion Stoica 为执行董事长、Matei Zaharia 为 CTO,并继续列出全部七位联合创始人。官方介绍称平台服务超过2万家机构,包括财富500强的70%;这些采用规模数字来自公司自身披露。[1][2]

来源

  1. About Databricks(在新窗口打开)
  2. Databricks Founders(在新窗口打开)
  3. 10 Hot Data Science Companies with Berkeley Roots(在新窗口打开)
  4. March 2018: Azure Databricks is now generally available(在新窗口打开)
  5. The MLflow Project Joins Linux Foundation(在新窗口打开)
  6. The Delta Lake Project Turns to Linux Foundation(在新窗口打开)
  7. Databricks on Google Cloud(在新窗口打开)
  8. Databricks Completes Acquisition of MosaicML(在新窗口打开)
  9. Databricks Agrees to Acquire Tabular(在新窗口打开)
  10. Neon and Databricks(在新窗口打开)
  11. About Neon(在新窗口打开)
  12. Databricks Grows >80% YoY, Surpasses $7B Revenue Run-Rate(在新窗口打开)
  13. Databricks to Invest More Than US$350 Million in Singapore(在新窗口打开)
  14. Databricks Partners with EDB and IMDA(在新窗口打开)
  15. Data Lakehouse Architecture(在新窗口打开)