阿里巴巴计划开发拥有5万亿至10万亿参数的AI模型,并推出新芯片
阿里巴巴宣布计划开发一款包含5万亿至10万亿参数的人工智能模型。与此同时,该公司还发布了一款专为支持其基础设施需求而设计的全新定制芯片。
阿里巴巴宣布计划开发一款包含5万亿至10万亿参数的人工智能模型。与此同时,该公司还发布了一款专为支持其基础设施需求而设计的全新定制芯片。
由于中国国内需求超过可用供应,华为已暂停其人工智能芯片的国际化扩张。这一战略转变意味着AMD和Nvidia等竞争对手不再面临华为进入全球市场的直接压力。
Hugging Face上的一项提案讨论了AI中的两个相互关联的问题:对训练独立大型模型的依赖,以及生态系统对通用GPU的依赖。
llama.cpp 项目发布了构建版本 b11059,其中针对 Apple Silicon 硬件的 Metal 后端引入了重大更新。主要更改是为快速沃尔什-哈达玛变换(FWHT)内核添加了 F16 输入支持,使其能够直接读取 F16 源数据,而无需进行转换副本。
llama.cpp项目已将Vulkan mul_mat_id操作的提升行ID限制从256个专家提高至1024个专家。此更改解决了具有大量专家的模型(如Qwen3.8-Flash-Next)中的性能瓶颈,这些模型此前因共享数组大小限制而运行在较慢的代码路径上。
llama.cpp 项目发布了版本 b10997,其中包括对 Mixture of Experts (MoE) ncols_opt 图块启发式算法的更改,以支持 RDNA3.5 架构。
llama.cpp b10994 版本包含对 Metal 后端的修复,解决了当激活值超过 f16 范围时 `mul_mm_id` 操作产生的 NaN 输出。此缺陷此前会导致 Mistral Small 4 等模型在 Apple Silicon 设备上对 32 个或更多 token 进行预填充步骤时生成完全为 NaN 的词表。
研究人员提出了 ShareMMU,一种 IOMMU 设计,允许多个不可信的加速器在共享虚拟地址空间内安全地重用已翻译的地址。这种方法在保持高性能的同时,减轻了与大型共享转换旁路缓冲区(TLB)相关的侧信道风险。
作者构建了MOLT,这是一个面向Windows的运行时环境,用于在消费级NVIDIA GPU上进行热感知QLoRA微调,并使用一个RTX 4060笔记本GPU上的100万个Qwen 1.5B训练目标将其与Unsloth进行了基准测试。
一位用户开发了自定义实现,允许 DeepSeek V4.1 模型在 NVIDIA A100 GPU 上运行,其性能超过了官方 API。
Hugging Face论坛上的一项提案概述了一个通用的GPU执行与显存管理层,旨在将应用代码与NVIDIA、AMD和Intel等特定硬件供应商解耦。其目标是让用户能够指定显存预算,而非手动配置后端特定的标志位、设备映射或卸载策略。
研究人员提出了 Onyx,这是一种面向 disk-oblivious 近似最近邻(ANN)搜索的成本高效方法,通过反转当前最先进的 ORAM-ANN 系统的设计,在带宽和访问次数之间取得平衡。
来自 NVIDIA 的研究人员推出了 GPIR,这是一种在 GPU 上加速私有信息检索(PIR)的系统,通过解决基于格协议固有的高服务器端计算和内存流量问题来实现。该系统采用了一种感知阶段的混合执行模型,动态切换操作级和阶段级内核,以最大化片内数据重用。
一项新研究提出了针对隐私保护机器学习推理的安全多方计算 (MPC) 和全同态加密 (FHE) 的统一系统级特征分析。该工作评估了两种 MPC 变体——算术/二进制共享转换和函数秘密共享——以及 FHE 在多个 CNN 和 Transformer 模型上的表现。
Together AI 的内核团队已优化 ThunderKittens 库,以利用 NVIDIA Vera Rubin NVL72 平台的新特性,专门提升 NVFP4 和 FP8 矩阵乘法的性能。
Together AI 宣布 Together GPU Clusters on Kubernetes 的预emptible计算公开预览,为可容忍中断的工作负载提供更低成本的选项。预emptible节点利用未使用的 NVIDIA accelerated 容量,并按按需费率的固定50%计费。
llama.cpp 项目发布了 b10891 版本,解决了 PowerVR GPU 上的一个关键稳定性问题。该更新修改了 Vulkan 后端,使其在去量化矩阵-向量乘法(dmmv)操作中回退到共享内存归约。
麻省理工学院工程量子系统组的Beatriz Yankelevich使用与Codex集成的GPT‑5.6 Sol,自主运行并优化超导量子比特的常规测量。这种集成使AI代理能够操作实验室软件、分析结果,并在无需持续人工监督的情况下决定后续步骤。
在过去11个月里,Anthropic获得了价值5170亿美元的算力租赁容量,总计14.8GW,主要与Google和AWS合作。此次扩展包括与Akamai和Fluidstack等云提供商的大型交易,以及与Nscale达成的450亿美元协议。
llama.cpp 项目发布了版本 b10839,解决了因张量行检索操作中的未对齐偏移而在 Vulkan 后端引发的严重崩溃问题。此前,在使用带有非零视图偏移的 `ggml_view` 时,Qwen3-TTS 和 Qwen3-VL 等模型会失败,因为着色器会对相对于 `minStorageBufferOffsetAlignment` 的对齐违规进行断言。此次更新在量化和非量化路径中实现了对齐偏移的原生支持,从而消除了对 CPU 回退的需求。