Um novo projeto chamado vLLM Launcher foi lançado como um aplicativo de desktop para Windows projetado para gerenciar a inferência de modelos de linguagem grandes locais por meio do WSL2. Esta ferramenta permite que os usuários controlem vários backends de motores, incluindo vLLM, SGLang e llama.cpp, a partir de uma única interface gráfica.
- Gerenciamento multi-motor para vLLM, SGLang e llama.cpp via uma única UI de desktop.
- Gateway de API local oferecendo endpoints compatíveis com OpenAI e Anthropic.
- Cartões de instância para iniciar, parar, reiniciar e inspecionar fluxos de trabalho de modelos.
- Recursos incluem logs de solicitação, verificações de saúde, métricas de tempo de execução e descoberta de modelos em disco.
- Modo flutuante para monitoramento compacto do status enquanto se usa outros aplicativos.
A ferramenta conecta os motores WSL a qualquer IDE compatível com OpenAI, com a pilha tecnológica subjacente construída em Go, Wails, React, TypeScript e Node.js. O primeiro lançamento público está disponível como um executável portátil para Windows.