Um novo projeto chamado vLLM Launcher foi lançado como um aplicativo de desktop para Windows projetado para gerenciar a inferência de modelos de linguagem grandes locais por meio do WSL2. Esta ferramenta permite que os usuários controlem vários backends de motores, incluindo vLLM, SGLang e llama.cpp, a partir de uma única interface gráfica.

  • Gerenciamento multi-motor para vLLM, SGLang e llama.cpp via uma única UI de desktop.
  • Gateway de API local oferecendo endpoints compatíveis com OpenAI e Anthropic.
  • Cartões de instância para iniciar, parar, reiniciar e inspecionar fluxos de trabalho de modelos.
  • Recursos incluem logs de solicitação, verificações de saúde, métricas de tempo de execução e descoberta de modelos em disco.
  • Modo flutuante para monitoramento compacto do status enquanto se usa outros aplicativos.

A ferramenta conecta os motores WSL a qualquer IDE compatível com OpenAI, com a pilha tecnológica subjacente construída em Go, Wails, React, TypeScript e Node.js. O primeiro lançamento público está disponível como um executável portátil para Windows.