Buddy System 使用 Rust 熵监测器来检测本地 Gemma 3 4B 推理中的逐 token 不确定性,仅通过 NER 门控跨度提取和语义检索将不确定的 token 路由到 Sonnet。基准测试显示,它以 0.21 美元的成本实现了 71.4% 的准确率,在七个 Hugging Face 数据集上优于 Anthropic Advisor 模式(0.44 美元时 62.9%),其中通过将源段落块路由到云模型,在 SQuAD v2 上取得了关键改进。
media
Hugging Face Forums
·
92 天前
·
open_models
伙伴系统:用于分层LLM推理的带有NER门控不确定性的Rust熵监测器
译自 English → 中文
重要性 2/3
超越顶级实验室的 benchmark
可信度 1/3
Hugging Face Forums
Hugging Face
Code generation
Reasoning models
相关文章
lab
Hugging Face Blog
·
13 天前
·
24 次浏览
Gradio 发布 Workflow1111,将 AUTOMATIC1111 功能重建为 Gradio 图
Gradio 发布了 Workflow1111,该项目使用 gr.Workflow 框架重建了 AUTOMATIC1111 的 stable-diffusion-webui 的大部分功能集。该应用程序由一个包含十一个媒体管道的单一画布组成,这些管道由七十三节点构建,涵盖文生图、图生视频以及各种预处理任务。
media
Hugging Face Forums
·
92 天前
·
15 次浏览
AI音乐模型在浏览器中实时运行于大多数CPU
NanoMaestro Realtime是一个50MB的AI音乐模型,拥有13M参数,使用2层LSTM实时生成钢琴音乐。它通过ONNX和Transformers.js与WASM在浏览器本地运行,无需GPU或服务器后端,并可在较旧的树莓派型号上工作。
lab
OpenAI News
·
94 天前
·
8 次浏览
GPT-5.5 Instant 增强 ChatGPT 的健康回复
GPT-5.5 Instant 通过更强的推理能力、更好的上下文处理、更清晰的沟通以及医生指导的评估,提升了 ChatGPT 在健康与保健方面的回复质量。
media
Medium (Barnacle Goose)
·
488 天前
·
35 次浏览
Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
Anthropic发布了两款新的大型语言模型Claude Opus 4和Claude Sonnet 4,它们引入了“混合推理”功能,将快速响应与逐步思考相结合。这些模型取代了Claude 3.x系列,保留了200,000个token的上下文窗口,同时提升了安全性和代理能力。
media
DataCamp
·
546 天前
·
45 次浏览
Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
Google 发布了 Gemini 2.5 Pro,这是 Gemini 2.5 系列中的首款模型,也是迄今为止最强大的推理模型。该模型具备 100 万 token 的输入上下文窗口(计划进一步扩展),支持包括文本、图像、音频和视频在内的多模态输入,目前可通过 Gemini Advanced 计划和 Google AI Studio 使用。