NVIDIA发布用于零样本表格预测的开源Kumo Tabular基础模型
NVIDIA发布了Kumo Tabular,这是一个用于表格分类和回归的开源基础模型,通过上下文学习运行,无需训练或特征工程。该模型仅在由结构因果模型生成的人工数据上进行预训练,提供三种规模,参数量从28M到215M不等。
NVIDIA发布了Kumo Tabular,这是一个用于表格分类和回归的开源基础模型,通过上下文学习运行,无需训练或特征工程。该模型仅在由结构因果模型生成的人工数据上进行预训练,提供三种规模,参数量从28M到215M不等。
Holo4是H公司推出的一系列新型智能体模型,提供27B密集型和35B-A3B混合专家两种规格。这些模型可通过任何界面(包括GUI、代码、MCP或API)与软件交互,并能在桌面端、网页、Android设备及沙箱环境中使用同一模型运行。
开放TTS排行榜已发布,旨在通过使用客观指标而非仅依赖缓慢的竞技场式人类偏好评分,解决语音合成(TTS)评估中的碎片化和缺乏标准化问题。它使用Qwen3 ASR和WavLM嵌入来评估模型的可懂度、速度和说话人相似度。
ProvenanceGuard 是 Model Context Protocol (MCP) 代理的生成后验证层,通过确保声明归因于正确的证据来源来检测跨源混淆。该系统在不重新训练代理的情况下分析捕获的 MCP 跟踪记录,将答案分解为声明,并验证支持来源是否与输出中命名或暗示的来源匹配。
Liquid AI 发布了 LFM2.5-VL-DSpark 草稿模型,这是一种推测解码的草稿生成器,旨在加速 LFM2.5-VL-3B 视觉语言模型的推理。该草稿生成器从目标模型的固定层捕获隐藏状态以生成候选 token,仅增加 280M 参数(开销为 8.9%),同时保持跨模态的维度一致。
基于 NVIDIA Warp 构建的 MuJoCo Warp (MJWarp) 允许兼容的 MuJoCo 模型在 GPU 规模上运行,从而在一次调用中推进数百或数千个独立仿真世界的进展。这种架构将重点从最小化单个环境的延迟转移到提高聚合吞吐量,这有利于强化学习和大规模采样。
NVIDIA 发布了 Nemotron 3 Diarization,这是一款用于实时说话人分离的开源权重、100M 参数模型,支持多达八位说话人。该模型在 VoiceArena 的 Diarization-Bench 排行榜上排名第一,说话人错误率(DER)为 14.72%,比排名第二的系统相对降低了约 24%。
英国人工智能安全研究所(AISI)已通过 EvalEval 的 Evaluation Cards 平台公开了评估方法和发现,以提高基准测试的可复现性。此次发布包含五个特定基准测试的验证结果、背景信息和配置信息:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0。
Hugging Face 的 Transformers 库现在支持加载 GGUF 量化模型,利用底层 ggml 内核使性能接近 llama.cpp。此集成允许开发者在支持的硬件上直接在标准的 PyTorch API 中运行量化检查点。
oMLX 的创建者和维护者 Jun Kim 已加入 Hugging Face,以支持 MLX 社区。此举旨在通过将该项目从副业转变为完全维护和资助的计划,为开源项目提供稳定性和更快的开发速度。
tokenizers 库发布了版本 1 的候选版本,显著提升了文本编码的性能,解决了训练和服务工作流中的瓶颈。该更新在保持与 v0.23 API 兼容的同时,为十个模型系列带来了大幅度的加速。
Multiverse发布了一篇论文,详细介绍了一种将大型语言模型剪枝重新表述为约束二进制优化问题并映射到伊辛玻璃的方法。通过将Transformer块视为具有由损失海森矩阵导出的成对耦合的自旋,该方法无需迭代基准测试即可识别最优的块移除配置。
研究人员在 ALTK-Evolve 系统中引入了“一致性准则”,这是一种旨在解决 LLM 代理性能可变性的新机制,而标准平均准确率指标往往掩盖了这种可变性。通过识别并稳定容易翻转的决策点,该方法在不牺牲整体能力的情况下显著提高了任务成功的一致性。
TRL v1.14 为 AsyncGRPOTrainer 引入了 LoRA 支持,使其能够训练低秩适配适配器,并仅将该小文件同步到 vLLM 推理工作节点。该架构通过使用共享存储桶作为文件系统桥接,将不同机器上的训练和生成作业解耦,消除了节点间对 NCCL 或直接网络通信的需求。
Gradio 发布了 Workflow1111,该项目使用 gr.Workflow 框架重建了 AUTOMATIC1111 的 stable-diffusion-webui 的大部分功能集。该应用程序由一个包含十一个媒体管道的单一画布组成,这些管道由七十三节点构建,涵盖文生图、图生视频以及各种预处理任务。
IBM发布了Granite Time Series PatchTST-FM-r2,这是一个约3.85亿参数的时间序列基础模型,在GIFT-Eval排行榜上以宽松的商业许可证实现了最先进的零样本性能。
Multiverse Computing的一篇论文介绍了一种训练语言模型仅拒绝特定有害子集而非整个类别的方法,以解决粗粒度主题级护栏的局限性。该方法使用带有覆盖修复和分布内良性数据的边界感知自蒸馏,在降低对合法提示误拒的同时保持安全性。
研究人员推出了NeoMME,这是一系列包含260M和800M参数的多语言多模态编码器,使用单个双向Transformer处理文本和原始图像块。与生成式视觉语言模型不同,NeoMME不依赖独立的预训练视觉塔或因果解码器,而是通过掩码离散扩散目标从头开始训练整个模型。
Hugging Face 发布了 funes,这是一个将现有编码代理会话日志转换为 Claude Code、Codex、pi 和 Hermes 的持久化、可搜索记忆层的工具。它使用向量和 BM25 搜索在本地索引轨迹,允许代理在没有外部服务的情况下检索确切的来源。
本指南演示了如何使用组相对策略优化(GRPO)对 Liquid AI LFM2.5-350M 模型进行微调,以增强结构化输出生成。该过程涉及在 NVIDIA Nemotron 数据集的子集上进行训练,并通过 IFStruct 基准测试评估性能。