微软研究院展示卸载物理AI推理可提升机器人性能与电池续航
微软研究院挑战了物理AI推理必须仅在机器人 onboard GPU 上运行的假设,证明将推理任务卸载到边缘或云基础设施可显著提升移动操作工作负载的性能。他们对机器人工作负载进行的系统研究表明,依赖 onboard 计算会限制性能、电池续航和可扩展性。
微软研究院挑战了物理AI推理必须仅在机器人 onboard GPU 上运行的假设,证明将推理任务卸载到边缘或云基础设施可显著提升移动操作工作负载的性能。他们对机器人工作负载进行的系统研究表明,依赖 onboard 计算会限制性能、电池续航和可扩展性。
Parallel 已将 OpenAI 的 GPT-6 Astra 集成到其 AI 代理基础设施中,与之前的模型相比,研究时间和代码成本均降低了 50%。该公司表示,新模型使代理能够以显著更快的速度完成复杂的知识工作,同时保持高质量的输出。
研究人员引入了并行解码蒸馏(PDD),这是一种简化的基于轨迹的方法,用于加速扩散模型和流匹配模型的推理。与当前依赖难以优化的变分分数蒸馏和对抗性损失的方法不同,PDD 在每次网络评估中预测多个去噪步骤。
研究人员提出了 Onyx,这是一种面向 disk-oblivious 近似最近邻(ANN)搜索的成本高效方法,通过反转当前最先进的 ORAM-ANN 系统的设计,在带宽和访问次数之间取得平衡。
来自 NVIDIA 的研究人员推出了 GPIR,这是一种在 GPU 上加速私有信息检索(PIR)的系统,通过解决基于格协议固有的高服务器端计算和内存流量问题来实现。该系统采用了一种感知阶段的混合执行模型,动态切换操作级和阶段级内核,以最大化片内数据重用。
一项新研究提出了针对隐私保护机器学习推理的安全多方计算 (MPC) 和全同态加密 (FHE) 的统一系统级特征分析。该工作评估了两种 MPC 变体——算术/二进制共享转换和函数秘密共享——以及 FHE 在多个 CNN 和 Transformer 模型上的表现。
OpenAI已将其内部在线存储平台Habitat的容量扩展至每秒处理超过7000万次请求,以支持近40个地理区域中每周超过10亿的ChatGPT用户。该系统现在服务于超过500 PB的数据,从简单的Python客户端库演变为复杂的分布式服务。
DeepSeek 发布了 V4.1-Flash,这是一款专为极致推理效率和低成本设计的新款开源权重旗舰模型。该模型采用因果编码器-解码器架构,显著降低了活跃计算量和 KV/缓存成本。
DeepSeek推出了DeepSeek v4.1-Flash,这是一款全新的开源权重旗舰模型,采用了新型因果编码器-解码器架构,旨在最大化推理效率并降低成本。
DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
vLLM 项目发布了 0.29.0 版本,其中包括关于密集前缀缓存的核心错误修复。
v0.29.0rc5 版本将 `prefix_cache_retention_interval` 参数的默认值更新为 `dense`,专门针对 Mamba 模型。
llama.cpp 项目发布了构建版本 b11284,其中包含针对 OpenVINO 后端的修复,以正确处理量化权重视图上的 GET_ROWS 操作。
llama.cpp 项目发布了版本 b11280,其中包括通过使用固定主机缓冲区来减少张量 allreduce 同步的更改。
llama.cpp 项目发布了构建版本 b11282,其中包括为 MUSA 设备传递定义 `CUDA_ARCH` 宏的修复。此前,MUSA 供应商头文件未能定义此变量,导致共享 ggml-cuda 源代码中的架构测试评估为零,从而产生空的内核体。
llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
llama.cpp 项目发布了构建版本 b11273,引入了对重排序模型中 `classifier_pooling` 方法的支持,专门针对 ModernBERT 架构。
llama.cpp 项目发布了构建版本 b11272,其中包括针对 Hexagon 后端的优化。主要更改集中在优化连接操作,以提高 Qualcomm Snapdragon 硬件上的性能。
研究人员引入了上下文语言模型(CLM),这是一种新架构,将模型的上下文窗口视为可编辑的文件,允许模型对其自身记忆进行无限制的更新。这种方法将上下文管理从外部控制框架转移到模型内在行为,实现了上下文管理策略的上下文中学习和参数化学习。
AI Hardware Fit 的创作者发布了一款免费开源浏览器工具,旨在帮助用户判断本地模型是否适配其 GPU,并比较合适的硬件选项。该工具解决了从不同来源拼凑模型文件、量化方式、上下文长度和运行时支持所面临的复杂性。