O modelo Qwen 3.8 27B, executado em FP8 com uma janela de contexto de 256K via vLLM, alcançou uma pontuação de 72.9 no benchmark Aider.
- A pontuação iguala Gemini 2.5 Pro (72.9) e supera Claude Opus 4 (72.0) e DeepSeek R1 (71.4).
- O autor observa que, embora o benchmark possa estar desatualizado, o desempenho do modelo em um MacBook é comparável aos modelos state-of-the-art de mais de um ano atrás.
- O desempenho real é descrito como superior a esses modelos devido às melhorias no framework de teste.