Joakimpalm-Zen atualizou o Xyntetik Runner para treinar adaptadores LoRA diretamente usando os mesmos pesos GGUF quantizados que ele serve para inferência, eliminando a necessidade de uma cópia separada em FP16 para treinamento ou do tempo de execução.

  • Um LoRA de uso de ferramentas foi treinado contra um Qwen3-4B Q4_K_M GGUF congelado, alcançando precisão de 1.00 em chamadas exatas de ferramentas e seleção da ferramenta correta em avaliações com dados não vistos.
  • Duas execuções independentes com o mesmo GGUF base, conjunto de dados, semente e configuração produziram GGUFs de adaptador idênticos por byte com hashes SHA256 correspondentes.
  • Comparações entre quantizações BF16, Q8_0 e Q4_K_M mostraram que, embora todas tenham alcançado precisão de 1.00, o treinamento através do Q4 seguiu um caminho de otimização mensuravelmente diferente (similaridade cosseno 0.9926) em relação às versões de maior precisão.

O autor fornece artefatos completos de reprodutibilidade no Hugging Face, mas observa que o experimento é limitado a uma tarefa sintética estreita com poucos dados, servindo principalmente como uma demonstração do mecanismo de treinamento e das propriedades determinísticas, em vez de melhoria geral de capacidade.