Quatro grandes modelos de linguagem foram lançados na China no último mês: Kimi K3-2.8T, Qwen3.8-2.4T, DeepSeek-V4-Pro-0813-1.6T e GLM-5.3-743B.
Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 e GLM-5.3 lançados em um mês
xAI lança Grok 4.6; Alibaba abre Qwen3.8-MoE; DeepSeek V4 Pro GA
As principais notícias de IA desta semana destacam lançamentos importantes da xAI, Alibaba e DeepSeek, além de atualizações em modelos de vídeo abertos e infraestrutura de inferência.
Thinking Machines lança Inkling, Tencent atualiza Hy3 com licença Apache 2.0
A última compilação de artefatos de modelos abertos destaca lançamentos significativos da Thinking Machines e Tencent, junto com atualizações da Poolside e DeepSeek.
Lançamento de peso aberto do Qwen3.8, Kimi Code CLI, stack LLM da Netflix e software de chip da Alibaba
A Alibaba anunciou o lançamento de peso aberto do Qwen3.8, um modelo com 2,4 trilhões de parâmetros, enquanto também tornava open-source sua stack de software para o chip Zhenwu AI, visando reduzir a dependência do ecossistema CUDA da Nvidia.
Kimi K3, DeepSeek V4 Pro e GLM-5.2 comparados em benchmarks, licença e custo de serviço
Uma comparação entre três modelos esparsos Mixture-of-Experts de pesos abertos — Kimi K3 da Moonshot AI, DeepSeek V4 Pro e GLM-5.2 da Zhipu AI — avalia suas capacidades, termos de licenciamento e custos de serviço para cargas de trabalho de codificação e agentes em horizontes longos.
Destilação do deepseek-r1:8B para o Qwen3-0.6B permite enriquecimento estruturado de texto rápido em dispositivo
Pesquisadores demonstram que destilar um professor de raciocínio de 8B (deepseek-r1:8B) em um modelo estudante de 0.6B (Qwen3-0.6B via QLoRA) permite extração estruturada em alto volume com latência e custo significativamente menores. O estudo avalia essa abordagem no mapeamento de artigos de notícias para objetos JSON contendo resumos e rótulos categóricos, comparando o modelo destilado contra linhas de base de prompting few-shot e decodificação restrita.