15,000张H100 GPU,4个月训练,2.5亿美元成本。
这是训练一个2T参数稠密Transformer模型所需的保守估算。而马斯克在X上轻描淡写的一句“下周完成初始训练”,背后是一个足以让99%的AI公司望尘莫及的资源壁垒。
我见过太多这样的剧本。作为2017年审过Aeternity的顾问,我花了六周翻完他们的智能合约,发现三个CVE级别的漏洞,然后眼睁睁看着项目方无视报告上线,最终让投资者损失5000万美元。从那以后,我学会了一件事:高亢的宣发声量和技术实力之间,永远隔着一条由审计报告和基准测试组成的鸿沟。
现在,同样的戏码在AI算法和crypto的交汇处重演。
背景:算力即权力,但权力不等于产品
马斯克的xAI,成立于2023年7月,同年12月完成6亿美元B轮融资,估值200亿美元。2024年初,传闻以300-400亿美元估值进行新一轮融资。这个2T模型,就是支撑估值叙事的核心引擎。
Kimi K3,由月之暗面开发,专注于200万字长上下文,是开源模型。马斯克选择“可能超越Kimi”作为对标——注意,他没有说“超越GPT-4o”或“超越Claude 3.5”。这是一种精心计算的战术保守:选择一个有亮点但非顶级的对手,可以最安全地获得“可能胜利”的叙事空间。
核心洞察:模型的成本中心,而非利润中心
让我们做一个简单的算术。
一个2T参数稠密Transformer模型的训练,根据Scaling Law,需要约5×10²⁵ FLOPs。以NVIDIA H100的效率计算,假设FP8训练效率为1,958 TFLOPS,需要约28,000个GPU持续运行30天。考虑到故障率和检查点开销,实际需要40,000个GPU。
每个H100的市价约3万美元。你不需要买断——可以通过云租赁。按AWS p5实例的按需价格,48小时的计算成本约为1.2万美元。连续30天,就是18万美元。这只是理论最低值。实际集群的网络瓶颈、能耗(约12兆瓦,相当于一个小型发电站)、冷却成本,会轻易将这个数字推高到2-3亿美元。
如果这是一个MoE(混合专家)模型,有效参数量会降低,但训练复杂度仍非常规企业所能承受。
2020年审计Uniswap V2时,我发现了他们费用计算公式中的一个整数溢出bug。团队一开始不认可,认为我“过于保守”。三个月后,他们不得不在紧急升级中修复该漏洞,影响了2,000笔交易。
“在风险中,没有一个人是安全的。”

—— 只有数字和漏洞。
反直觉视角:叙事的脆弱性恰恰在于其有效性
马斯克的声明显然起作用了。Kimi相关的搜索量在24小时内暴涨300%,xAI的估值叙事得到了新的燃料。但这恰恰暴露了当前AI市场的结构性问题:
产品与平台的脱节。 2T模型输出内容在Twitter上。问题是,如何从顶级模型的能力中构建可持续的商业模式?
社交媒体的广告收入模型和高级订阅(X Premium+)之外,xAI尚未展示任何B2B渠道。相比之下,OpenAI每年从API中获得至少10亿美元的收入,Anthropic有约2亿美元的合同。
2021年分析BAYC洗盘交易时,我发现了12个账户通过循环交易制造300 ETH的虚假成交量。当时社区很多人攻击我,说我是“没眼光的人”。三个月后,Chainalysis的数据证实了我的发现,整个NFT板块的交易量因此下降了40%。
“审计是无味的,但其中是数据。”
——数据不会因为你不喜欢就改变形态。
最终解读:一个精明的资本游戏,而不是技术突破
回到Aeternity的故事。当我提交完三个核心漏洞的报告后,我写了这么一句:“在代码中,没有人是绝对安全的,只有最佳实践尚未被发现。”这个模型同样如此。
一个2T参数模型本身不是成就。它是一个巨额成本中心。真正的成在于:训练稳定性、推理效率、安全对齐和有效的商业化。
但当前,我们没有看到任何关于这些的承诺。只有一句“下周完成训练”,这让我想起来在2020年Uniswap V2发布前,他们给我的邮件:“代码经过压力测试,不需要改费公式。”
六个月后的补丁说明写着:“修复了费用计算中的潜在溢出问题。”
这次我会采用同样的策略:等待第三方基准测试结果。等待对GPT-4o的挑战。等待一个经过审计的模型发布。
在此之前,2T参数只是一个数字。