文章认为,在企业 AI 中,GPU 利用率而非模型智能已成为主要瓶颈,这与航空公司飞机的利用率类似,无论是否使用,成本都按小时累积。
- 企业 AI 的经济性现在取决于有多少硬件正在积极计算,因为基础设施的固定成本持续存在,而收入则取决于计算时长。
- 尽管规模扩大,计算资源依然稀缺,Anthropic 和 Meta 等主要实验室正从多家供应商处获得多吉瓦级的承诺,以保持竞争力。
- 企业正面临从可变 API 成本向自有 GPU 的固定资本支出的转变,使得闲置容量的管理对投资回报率至关重要。
- 集群因峰值配置与波动需求之间的不匹配而浪费容量,因为不同的工作负载(训练、推理、批处理)需要相互冲突的硬件配置。
- 有效的 GPU 管理需要持续的编排,以实时将特定工作负载分配给合适的 GPU,而不是依赖静态配置。
文章总结道,最大化已安装 GPU 的投资回报率现在是一个持续的操作挑战,需要自动化、智能的分配层来确保容量不仅被占用,而且用于高价值任务。