llama.cpp b10306 添加 SYCL GLU 扁平路径并整合内核
llama.cpp b10306 版本引入了针对 SYCL 后端的性能优化,特别针对门控线性单元(GLU)操作。此次更新为融合的 GLU 操作添加了连续的快速路径,并将之前不同的内核整合以共享一个通用的启动器。
llama.cpp b10306 版本引入了针对 SYCL 后端的性能优化,特别针对门控线性单元(GLU)操作。此次更新为融合的 GLU 操作添加了连续的快速路径,并将之前不同的内核整合以共享一个通用的启动器。
llama.cpp b10255 版本将 oneDNN SDPA 路径扩展为支持非 FP16 键值 (KV) 缓存,包括 Q4_0–Q8_0 量化格式和 FP32。此更新允许融合脉动核在设备上将 K/V 张量反量化或转换为密集 FP16 后,以与原生 FP16 路径相同的方式运行。
Lucebox 与 AMD 合作,展示了一种异构消费级硬件配置,其推理速度优于 Nvidia DGX Spark。该系统将 AMD Radeon AI PRO R9700 GPU 与 Strix Halo 处理器相结合,以运行完整的 284B DeepSeek V4 Flash 模型。
文章认为,在企业 AI 中,GPU 利用率而非模型智能已成为主要瓶颈,这与航空公司飞机的利用率类似,无论是否使用,成本都按小时累积。
Patience Strong 认为,当前的神经网络通过在软件中模拟电路而不是将其实现为物理硬件,消耗了过多的计算能力。该论文建议用半导体器件替换这种模拟,其中权重和偏置存储在非易失性存储器中。
Ai2推出了OlmoEarth平台,这是一个基础设施系统,旨在将地球观测基础模型从微调推进到大规模推理。该平台解决了跨多个提供商和分辨率处理TB级多模态卫星数据所面临的工程挑战。
Moonshot 已在 Hugging Face 上发布了 Kimi K3 模型的权重,该模型拥有 2.8 万亿参数,采用 mixture-of-experts 架构,每个 token 有 16 个活跃专家。团队计划将模型部署在 A100、H200 和 B300 GPU 上,基准测试结果预计将于本周公布。
llama.cpp 项目发布了版本 b10099,其中包括对 CUDA 后端的重大更新,以改善 NVFP4 W4A4 激活量化。
IBM已签署最终协议,收购拥有近80年科学贡献历史的研究机构HRL实验室。此次收购旨在通过整合HRL在硅自旋量子比特工程领域的先进专业知识,加速IBM的量子计算愿景。
AMD和Anthropic签署了一项涉及数百亿美元AI服务器的重大协议,Anthropic将从明年上半年开始购买多达2吉瓦的AMD Instinct MI450芯片。同时,随着特定部署里程碑的达成,AMD将向Anthropic投资高达50亿美元,两家公司还将合作确定适合该硬件的数据中心。
SLAI 推出 T-Rex,这是一个端到端优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型家族为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。
SLAI 推出 T-Rex,这是一个端到端的优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型系列为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。
美国能源部(DoE)已选定IBM牵头负责Genesis任务申请项目,承诺投入高达5000万美元的量子计算访问资源以支持该计划。
OpenAI公布了Project Camellia的详细信息,这是位于佐治亚州埃芬汉姆县的一个长期数据中心项目,概述了其在电力、水资源和当地利益方面的初步社区承诺。该公司正与Georgia Power Company签订合同,在2028年至2032年间交付3.2吉瓦的电力。
本TLDR AI通讯涵盖了人工智能行业的几项发展,包括新硬件、软件代理和路由优化。
Together AI 与 Y Combinator 宣布合作,为 Y Combinator 旗下 AI 原生初创企业提供首个专属 GPU 集群。该举措旨在通过提供灵活且具成本效益的训练与推理基础设施,解决计算资源获取的关键瓶颈,且无需长期承诺。
中国人工智能公司 Moonshot AI 成为中国首家 GPU 容量耗尽的公司。因此,该公司决定暂停新订阅并取消用户的免费访问权限。
Together AI 详细介绍了实现不同 GPU 推理可靠性层级所需的具体架构要求,并指出标准的 SLA 数字往往掩盖了实际覆盖的故障域。
NVIDIA 概述了如何通过与其 BlueField 处理器进行极致的协同设计来解决 Agentic AI 工作负载带来的基础设施挑战。该公司认为,随着智能体系统触发复杂的模型调用链、工具交互和数据查找,传统的基础设施模式已不足以维持性能。
NVIDIA 在 CUDA 13.3 中引入了一条用于无进位乘法的新 PTX 指令,填补了长期存在的空白:尽管 x86 CPU 上已有该操作超过十五年,但 GPU 一直缺乏原生支持。