Databricks 专家的观察,向开源倾斜明显 OpenAI和Anthropic在Databricks上的token消耗比重和趋势? Databricks方面

图片

无图片

正文

Databricks 专家的观察,向开源倾斜明显

OpenAI和Anthropic在Databricks上的token消耗比重和趋势?

Databricks方面,OpenAI和Anthropic的foundation model API在2026年8月累计收入已经超过数亿美元,这是从他们上线到现在的总收入,增长速度非常快。两家起步时间是2025年5月,起步阶段的三个月总收入为千万美元量级。之后,2025年8月至10月,三个月收入增长到数千万美元,一直到2026年2月至4月达到顶峰,季度收入为两亿多美元。2026年5月至7月,增长速度放缓,环比下降约一成,收入回落到两亿美元出头。整体来看,从2025年5月上线到2026年4月一直保持高速增长,4月达到顶峰后有所回落,这也与2026年5月新模型上线(如GLM、K3等)有关。整体趋势是高速增长后进入平稳期。

如果分别看Anthropic和OpenAI,Anthropic的入场时间是2025年4月。它的增长幅度很大,从最早一个月数百万美元增长到今年一季度末的千万美元,增长了十多倍。客户基数也从上线第一个季度的一千多个客户增长到现在的五千多个客户。客户基数从上线第一个季度的一千多个客户增长到现在的一千六百多个客户,增长速度不如Anthropic,但OpenAI的单客户花费高于Anthropic。整体来看,Anthropic的请求量是OpenAI的两倍多,Anthropic的token总请求量显著领先,OpenAI相对较少,Anthropic在请求量上占据主导地位。

Anthropic在5-7月收入贡献增长放缓,OpenAI在Q2客户增量也减少,未来两个季度会持续这个趋势?

后续不一定会反弹。根据销售预测,后面几个季度收入会比较平稳,大约每季度两亿多美元。2026年2月至4月有一个峰值,环比增长超过两倍,之后收入回落。后续虽然还会有新模型上线(如新的OSS等),但预计不会再维持之前的高速增长,可能进入平稳期。除非云或Anthropic有新的模型推出,但从销售预测来看,后续收入基本保持平稳。

从GLM或KIMI等模型产生的客户token需求是否体现在Foundation Model API里面?

不体现,因为这些是OSS模型,不属于Foundation Model API的范畴。

Databricks的下游客户所在的行业比重?

目前最大的客户行业是FSI。Anthropic请求量最大的两个模型是Haiku 4.5占五成和Sonnet 4.6占四成。剩下约一成是Opus和Fable等其他模型。Databricks支持的客户主要用Claude做coding任务较多。行业的话比较分散,Databricks整体来说比较横向分布。OpenAI方面,六成的收入来自GPT5.4 NANO,剩下四成由GPT5.6 SOL、Terra、Codex等模型平分,每个模型大约有数千万请求数。OpenAI在coding方面有专用的Codex模型,但请求量较少,更多客户选择Anthropic进行coding任务。

OpenAI 和 Anthropic 在 Databricks 上购买服务的支出趋势和订阅服务内容是否增加?

从二季度初来看,Anysphere最高,之后是OpenAI和Anthropic。他们的月度支出增长率水平接近。目前没有看到他们在其他服务上的用量显著增加。这两家客户主要还是使用现有的数据产品,对新推出的AI服务兴趣不大。

Anthropic收入在Q2放缓了主要是被哪家抢走了份额?

Q2增长最多的是Gemini,Gemini在2026年Q2大幅增长。Gemini有一次降价,并对batch inference进行了重要优化,带来了大量新用量。Gemini 3 Flash模型在Q2增长了约两倍多成,超过了Claude Sonnet 4.6和GPT 5.3。

现在头部模型中,Gemini的需求是增长趋势最强劲的?

是的,目前Gemini的需求增长最强劲,主要是因为今年Q2上线后进行了约三成多的降价,带来了大量新用量。如果Anthropic也降价,预计其用量也会快速增长。Databricks本月正在和Anthropic谈新的价格框架。

Gemini的batch inference优化具体成果?是成本大幅下降还是推理性能提升?

主要是成本大幅下降。Gemini对token计数方法进行了优化,很多cache的context不再计入input token,提高了cache命中率。

和国内模型厂的合作情况如何?未来会成为重要收入驱动力吗?

目前国内模型厂的收入非常少,因为他们刚上线,且多为开源(OSS),计费模式完全不同。例如Kimi和GLM 5.2,客户在Databricks平台上使用时,Databricks基本无法统计其用量。比如阿里的千问,因为它上线比较早,使用量增长很快。Kimi和GLM 5.2才上线两个月,具体怎么合作还没定。到时候Databricks应该也会和Kimi谈一个合作框架,比如超过多少就付费,或者一揽子总价。现在还在谈,我问了不少人,他们都说应该按照Kimi公开的开源收费标准和商业协议来,不一定会有Databricks专属的条款。

Databricks后面会主要更多地用开源模型,会挤占很大一部分旗舰模型的用量?

Databricks的态度是拥抱开源,不过同时也会优先Anthropic,把Anthropic的模型作为first party、first tier model提供给客户。其他商业模型,比如阿里,还在思考中。

国产这些模型厂是否采用Databricks或者Snow的SQL、Lakeflow等产品?

包括智谱和月之暗面,他们用的是阿里的data warehouse,还有阿里上的RDS。Databricks刚刚开始和他们谈,现在他们都没有用Databricks。

国产模型厂会是未来两个季度的重要获客?

国内未来两季度,Databricks的策略是把Databricks内部很多依赖模型都切到这些OSS上。对外部客户倒不是未来两个季度的重点。Databricks内部用了很多模型,比如Databricks自己做内部产品的一些insight、内部审计,包括公司运营的agent,未来两个季度要切到这些开源的国内模型上。

Databricks后续可能更倾向用哪家国产开原模型?考虑?

应该最多的是GLM 5.2,Databricks也对它做了最深入的优化。

Databricks和Snowflake的Postgres进展?会成为之后获客和客户spending考虑上的重要因素?

Lakebase的增长特别快,Lakebase ARR已经突破两亿美元,过去六个月翻倍,从上线到现在用量增长很快。Lakebase最大的使用来源是agents,即Agent Bricks和Databricks Apps,这两个产品自己创建的Lakebase实例对整体收入贡献三成多。Postgres在Snow是独立的OLTP数据库,而Lakebase在Databricks上和Delta Lakehouse结合得很紧,创建一个branch就能产生一个Lakebase实例,不需要复制数据。Think Table是客户以前用于分析的warehouse,直接点一下就能得到一个OLTP数据库,底层其实也是一份数据的copy。专门用于Think的这一块一年收入两千万出头,也挺高的。

跟Postgres的对比,他们是一个单独、独立出来的产品。而Lakebase在Databricks的Value Proposition中,产品定位是一个湖仓一体的运营数据库。Snowflake的Postgres应该是2024年发布的,Databricks的Lakebase GA更早一些,是2023年。差异化在于,Databricks的Lakebase与Delta Lake和Unity Catalog是原生集成的,而Postgres在Snow中是与Snow的Lakehouse完全并行独立的一个产品。对agent的支持方面,Lakebase原生支持agent,比如在agent中需要存储context或建立cache时,会自动创建一个Lakebase实例。而在Snow上,cortex agent需要先创建一个Postgres连接,cortex agent才会用Snow的Postgres作为交易数据库或context cache,没有那么原生集成。

两家的Postgres能力似乎并不是也不是客户考虑的重要因素之一?

我觉得这更多是背后的support。有的客户问Databricks,其实他们并不需要了解后端具体连接的是什么,如果只是做agent,后端连的是什么并不重要。但Databricks需要确保客户不要连接自己的Aurora、MySQL或Postgres等数据库,这是Databricks内部关心的事情。如果客户没有用Lakebase,Databricks会有各种方法让他用Lakebase。但客户一般不会要求Databricks比较Lakebase和Postgres的差异,也不会把这个作为主要的决定因素。

OLTP任务上客户为什么一定要选择Databricks和Snowflake,而不是Oracle Database、Amazon RDS或开源方案?

如果用Databricks Agent,想连接外部数据库会比较麻烦,需要自己建立connector。而用Lakebase是原生支持的,客户可以直接使用。Databricks很少遇到客户用Oracle或RDS来构建agent,可能这类客户根本没有选择Databricks。如果客户用Databricks构建agent,再用外部的商业事务型数据库,这种情况非常少见。我理解没有必要把这部分工作分到两个平台去管理。

Databricks对Agent的优势并不完全在于Lakebase本身。Databricks有一个完整的Story Telling去说服客户用Databricks构建Agent。首先是Data Intelligence,Agent除了具备通用智能,还要与数据结合。其次是统一治理,包括对context、数据和AI资产的整体治理。第三是Choice,没有厂商锁定,Databricks是开源的,用户可以自由迁移,比如Agent用的是MLflow 3.0,计算引擎是Spark,数据格式是Delta,这些都是开源的。Databricks未来能让Agent可以跨云实现灾备和负载均衡。Databricks可以部署在三大云上,客户可以在Azure和AWS各部署一份,通过唯一的endpoint实现云间切换和负载均衡。这样可以提升可靠性,实现DR(Disaster Recovery),比如Azure故障时切换到AWS。客户也可以根据不同云厂商的折扣或SLA灵活选择。这是Databricks补充的第三点优势,也是Databricks向客户介绍用Databricks构建Agent的价值主张。

总体总结

主题正文

  1. Databricks方面,OpenAI和Anthropic的foundation model API在2026年8月累计收入已经超过数亿美元,这是从他们上线到现在的总收入,增长速度非常快。
  2. 之后,2025年8月至10月,三个月收入增长到数千万美元,一直到2026年2月至4月达到顶峰,季度收入为两亿多美元。
  3. 2026年5月至7月,增长速度放缓,环比下降约一成,收入回落到两亿美元出头。
  4. 整体来看,从2025年5月上线到2026年4月一直保持高速增长,4月达到顶峰后有所回落,这也与2026年5月新模型上线(如GLM、K3等)有关。
  5. 客户基数从上线第一个季度的一千多个客户增长到现在的一千六百多个客户,增长速度不如Anthropic,但OpenAI的单客户花费高于Anthropic。
  6. 后续虽然还会有新模型上线(如新的OSS等),但预计不会再维持之前的高速增长,可能进入平稳期。
  7. Postgres在Snow是独立的OLTP数据库,而Lakebase在Databricks上和Delta Lakehouse结合得很紧,创建一个branch就能产生一个Lakebase实例,不需要复制数据。
  8. 第三是Choice,没有厂商锁定,Databricks是开源的,用户可以自由迁移,比如Agent用的是MLflow 3.0,计算引擎是Spark,数据格式是Delta,这些都是开源的。