vLLM Launcher 为本地 LLM 推理提供 Windows 桌面工作台
一个名为 vLLM Launcher 的新项目已发布,它是一个专为通过 WSL2 管理本地大型语言模型推理而设计的 Windows 桌面应用程序。该工具允许用户从单一图形界面控制多个引擎后端,包括 vLLM、SGLang 和 llama.cpp。
一个名为 vLLM Launcher 的新项目已发布,它是一个专为通过 WSL2 管理本地大型语言模型推理而设计的 Windows 桌面应用程序。该工具允许用户从单一图形界面控制多个引擎后端,包括 vLLM、SGLang 和 llama.cpp。
llama.cpp 项目发布了 b10330 版本,引入了一项 CUDA 优化,将 rms_norm、乘法和 RoPE 操作融合到单个内核中。此更改伴随着对融合操作的内存范围检查以及针对广播权重的新测试用例。
llama.cpp 项目发布了构建版本 b10328,引入了在服务器组件内使用 Docker 隔离工具的初步支持。此更新包括文档和代码适配,以分离工具 I/O 沙箱并重命名相关配置标志。
llama.cpp 服务器和 UI 已更新,以条件性地显示工作目录控件。以前,只要暴露了任何内置工具,此控件就会显示,即使没有任何工具实际使用它。
llama.cpp 项目发布了版本 b10327,其中包含对 CUDA 上量化拷贝内核启动的线程和块计数的修复。此更新解决了在 pull request #26731 中识别出的问题。
llama.cpp 项目发布了版本 b10313,为其服务器组件引入了最近最少使用 (LRU) 调度器。此更新包括请求合并的处理以及针对流式传输情况的修复。
llama.cpp 项目已发布 b10312 版本,其中包含对服务器组件的特定更新。主要更改解决了繁忙模型被路由器驱逐的问题。
llama.cpp 项目发布了版本 b10307,其中包含对 SYCL GPU 代码的修复,以正确解析 NVFP4 量化中使用的 UE4M3 缩放因子。
llama.cpp 项目发布了构建版本 b10298,其中为 mtmd 模块引入了新的块保存和加载功能。此更新还包括代码清理和额外的测试。
llama.cpp 项目发布了版本 b10282,引入了用于推测解码的新监控功能。服务器现在在其 /metrics 端点中包含了 spec-decode 计数器,允许用户跟踪与此功能相关的性能指标。
llama.cpp b10271 版本在 UI 中引入了按对话的工作目录功能,允许用户为每个聊天会话独立设置和导航目录。
llama.cpp 项目发布了 b10270 版本,引入了对 Qwen3-TTS 模型的支持。此更新包括对 llama-tts 二进制文件的破坏性更改,并实施了重要的架构修改以处理新的文本转语音工作流。
llama.cpp 项目发布了构建版本 b10259,引入了在加载过程中重塑张量的能力。
llama.cpp 项目发布了 b10254 版本,为 DeepSeek V4 Flash 0731 模型引入了新的聊天模板,并对现有的 DeepSeek V4 模板进行了更新。
llama.cpp 项目发布了 b10251 版本,引入了对 GLM-4.7-Flash 模型的多令牌预测 (MTP) 支持。
llama.cpp 项目发布了构建版本 b10238,其中引入了对 Qwen3-Next 模型系列的 Multi-Token Prediction (MTP) 支持。此更新包括处理 MTP 层的具体实现更改,以及修复代码库中与 Python 类型检查相关的问题。
llama.cpp 项目发布了构建版本 b10237,该版本为 DeepSeek V3.2 模型引入了多令牌预测(MTP)支持。
llama.cpp 项目发布了构建版本 b10232,通过 Metal 后端引入了对 DeepSeek V4 超连接的支持。此更新添加了 GGML_OP_DSV4_HC_COMB、GGML_OP_DSV4_HC_PRE 和 GGML_OP_DSV4_HC_POST 操作的实现。
llama.cpp 项目发布了 b10219 版本,其中包含一个 CLI 修复程序,用于在聊天历史中持久化推理内容。此前,虽然 `llama-cli` 从流中收集推理内容以供显示,但它仅在消息中存储助手内容,导致 `--reasoning-preserve` 标志无法在后续轮次中重新注入之前的思考。
llama.cpp 项目发布了 b10213 版本,引入了对旋转键值缓存量化的支持。此更新适用于广泛的平台和硬件加速器。