摘要
只能是巨头的游戏。 作者| 宇航猿 编辑| 靖宇 关于 AI 烧钱,业内流传着各种令人瞠目结舌的数字。xAI 花了超过 10 亿美元建起 Colossus 超算集群;OpenAI 的月度算力账单据称高达数亿美元;Anthropic 最近几轮融资拿到的钱,在公众眼里几乎已经和「GPU 时数」直接画上了等号。 大家谈的,几乎都是算力。GPU 成了衡量一家 AI 公司实力的通用货币,也是每一篇融资报道里最显眼的那个数字。 但最近,我听了一期 Latent Space 播客,采访对象是 xAI 前研究员 Ethan He——Ethan 在 2025 年中加入 xAI 时,面对的是一个没有基础设施、没有数据、没有现成模型的白纸状态,然后用三个月时间和一支小团队,从零搭建出了 Grok Imagine 视频生成系统,做到了当时业内的一流水准。 在聊到大规模视频模型的训练成本时,他说了一组数字,让我突然意识到,这个行业可能一直在算错了账。 「 光是存储这些视频和特征数据,每个月就要几百万美元——这还没算算力成本 。」 01 账单上的隐藏成本 从零到一,开始训练一个视频大模型,需要花多少钱?先假设你的团队有矿,GPU 算力随便用。即便如此,你可能依然低估了这件事的巨量成本。 假设你要训练一个世界级的视频生成模型,去网上爬取了 10 亿条视频,每条平均 5MB——这已经是相当保守的估计了。光这一项,你就需要 5PB(拍字节)的存储空间。按照 AWS S3 的定价,5PB 标准存储,每个月大约 10 万美元。 但这还只是原始视频。 在训练视频模型之前,业界通行的做法是先用 VAE(变分自编码器)把视频压缩成「潜在空间」的特征向量——因为一段视频展开成像素,可能有几十亿个 token,任何 Transformer 都处理不了,必须先压缩成模型能理解的连续向量。 问题是,这份压缩后的特征数据,体积和原始视频相当,同样需要长期存储,随时备用。 两项叠加,数十 PB, 每月存储费就超过 20 万美元 。 然后是最出乎意料的那一项:数据进出费(egress/ingress)。 Ethan 说, 从互联网下载 10 亿条视频的带宽费用,在 AWS 上比存储这些视频还贵 。每次训练,数据都要从存储层拉到计算层跑一遍。