Nokia Applied Research发布了AnyJev,该项目使用户能够在单次前向传递中直接从LLM的内部状态中提取可信的决策。
- 该方法无需生成循环、解析或微调。
- 它有效地将缓慢的聊天机器人转换为快速且廉价的确定性分类器。
Nokia Applied Research发布了AnyJev,该项目使用户能够在单次前向传递中直接从LLM的内部状态中提取可信的决策。
研究人员提出了TokenProbe,这是一个解决思维链(Chain-of-Thought)推理中高令牌消耗问题的框架,它利用了序列中令牌值的非均匀性。该方法使用归一化对数概率来区分核心结构令牌和冗余填充物,从而实现选择性压缩。
独立研究员Mohamed Menasy发布了GlucoEdge,这是一项工程研究,详细阐述了基于连续血糖监测器数据进行五类、15分钟血糖趋势预测的端到端设备端机器学习流水线。该工作引入了一个仅包含2,909个参数的紧凑1D CNN,并涵盖了从PyTorch到LiteRT转换的完整工作流程。
一位独立研究人员发表了一篇文献综述,分析了量化、剪枝和知识蒸馏等模型压缩技术是否真正降低了实测能耗,还是仅仅减少了 FLOPs。
Multiverse Computing 推出了量化感知修复(QAH),这是一种直接从原始预压缩教师模型中蒸馏压缩、量化大语言模型的方法。将其应用于压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型时,该方法产生的模型在 9 项基准测试中的 7 项上优于其自身的 bfloat16 全精度版本。
研究人员提出减少矩阵乘法(RMM),这是一种无需训练、输入自适应的推理方法,通过在收缩维度上选择信息丰富的切片来降低 Transformer 矩阵乘积,而无需修改模型权重。在简单的保留率控制下,RMM 在参数量从 1B 到 70B 的语言模型中提供了平滑且可预测的精度-效率权衡。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策