vLLM Launcher 为本地 LLM 推理提供 Windows 桌面工作台
一个名为 vLLM Launcher 的新项目已发布,它是一个专为通过 WSL2 管理本地大型语言模型推理而设计的 Windows 桌面应用程序。该工具允许用户从单一图形界面控制多个引擎后端,包括 vLLM、SGLang 和 llama.cpp。
一个名为 vLLM Launcher 的新项目已发布,它是一个专为通过 WSL2 管理本地大型语言模型推理而设计的 Windows 桌面应用程序。该工具允许用户从单一图形界面控制多个引擎后端,包括 vLLM、SGLang 和 llama.cpp。
llama.cpp 项目发布了构建版本 b10331,其中包含对服务器 `get_info` 端点的修复。此前,当未提供显式当前工作目录时,即使配置了 tools runtime,该函数也会错误地回退到服务器进程的 working directory。
llama.cpp 项目发布了 b10330 版本,引入了一项 CUDA 优化,将 rms_norm、乘法和 RoPE 操作融合到单个内核中。此更改伴随着对融合操作的内存范围检查以及针对广播权重的新测试用例。
llama.cpp 项目发布了构建版本 b10328,引入了在服务器组件内使用 Docker 隔离工具的初步支持。此更新包括文档和代码适配,以分离工具 I/O 沙箱并重命名相关配置标志。
llama.cpp 项目发布了版本 b10327,其中包含对 CUDA 上量化拷贝内核启动的线程和块计数的修复。此更新解决了在 pull request #26731 中识别出的问题。
llama.cpp 项目发布了构建版本 b10326,通过包含声码器传递来修改时间测量的计算方式。
llama.cpp 项目发布了版本 b10321,其中包含对 Metal 上 GGML_OP_NORM 和 GGML_OP_RMS_NORM 操作的关键修复。此次更新解决了由于丢弃的部分求和导致线程组大小留下部分 SIMD 组时,均值和方差计算不正确的问题。
llama.cpp 项目发布了构建版本 b10322,其中包含一项性能优化,可在 SYCL 后端合并 SSM_CONV 窗口加载。
llama.cpp 项目发布了版本 b10313,为其服务器组件引入了最近最少使用 (LRU) 调度器。此更新包括请求合并的处理以及针对流式传输情况的修复。
llama.cpp 项目发布了构建版本 b10311,其中包含对 Qwen3-TTS 管道的修复。此次更新解决了模型在生成过程中两次读取输入语句的问题。
llama.cpp 项目已发布 b10312 版本,其中包含对服务器组件的特定更新。主要更改解决了繁忙模型被路由器驱逐的问题。
llama.cpp 项目发布了版本 b10307,其中包含对 SYCL GPU 代码的修复,以正确解析 NVFP4 量化中使用的 UE4M3 缩放因子。
llama.cpp 项目发布了构建版本 b10305,在 SYCL 后端引入了对特定 DSv4 操作的支持。此更新包括 LIGHTNING_INDEXER、DSV4_HC_COMB、DSV4_HC_POST 和 DSV4_HC_PRE 算子的实现。
llama.cpp b10306 版本引入了针对 SYCL 后端的性能优化,特别针对门控线性单元(GLU)操作。此次更新为融合的 GLU 操作添加了连续的快速路径,并将之前不同的内核整合以共享一个通用的启动器。
llama.cpp 项目发布了构建版本 b10298,其中为 mtmd 模块引入了新的块保存和加载功能。此更新还包括代码清理和额外的测试。
llama.cpp 项目发布了构建版本 b10293,其中包括为 gfx1151 架构引入 AMD ROCm 持续集成,并解决了集成式 RDNA3.5 GPU 上的正确性问题。
llama.cpp 项目发布了 b10291 版本,其中包括针对 Vulkan 后端的重大修复以及标准的平台更新。主要技术变更解决了提交批处理大小问题,并引入了用于驱动程序错误的新诊断功能。
llama.cpp 项目发布了构建版本 b10290,在 ggml 库中引入了新的 `ggml_build_forward_order` 函数。此更改解决了 mtmd 音频图中的错误,该错误在使用 `ggml_build_forward_expand` 作为纯排序提示时,导致未选中的分支使用陈旧输入执行。
llama.cpp b10289 版本加固了服务器的 file_glob_search 目录遍历,以防止在 Windows 联接点上出现无限循环,并改进了对不可读目录的错误报告。
名为 QuantCheck 的新工具强调,预训练的最终检查点可能不是 4 位量化的最佳选择,因为基准测试可能保持平稳,而脆弱性却在增加。作者观察到 Pythia-160m 上存在这种模式,其中最终检查点遭受的质量损害大约是同等质量早期检查点的四倍。