O Claude Code v2.1.181 introduz suporte para definir configurações por meio da sintaxe de prompt, como /config thinking=false, adiciona suporte a Eventos Apple em sandbox no macOS e melhora o streaming, a nova tentativa automática e o comportamento do subagente. Também corrige diversos bugs relacionados à inicialização, manipulação de arquivos, área de transferência e responsividade da interface em todas as plataformas.
Notas de Lançamento do Claude Code v2.1.181
Estudo de faturamento do Claude Code mostra que a redução de contexto não reduz custos
Um estudo de 2.848 execuções do Claude Code faturadas pelo provedor revela que reduzir o contexto recuperado ou a saída de ferramentas não reduz confiavelmente o custo real faturado dos agentes de codificação. A pesquisa desafia a métrica comum de remoção de texto analisando uma campanha de 2.908 execuções em três modelos e sete repositórios.
Acompanhamento: DeepSeek V4 Flash em 2x RTX PRO 6000 finaliza tarefas reais de codificação mais rápido que Sonnet e Opus, com qualidade aproximada à do Sonnet
Uma avaliação de benchmarking subsequente avalia o DeepSeek V4 Flash rodando em duas GPUs RTX PRO 6000 usando vLLM, comparando seu desempenho em tarefas reais de codificação contra modelos baseados em API como Claude Sonnet e Opus. O estudo descobre que, embora Opus e Fable mantenham qualidade superior de código, o DeepSeek V4 Flash atinge uma qualidade aproximadamente ao nível do Sonnet com tempos de parede significativamente mais rápidos.
TestEvo-Bench: Um Benchmark Executável e ao Vivo para a Co-Evolução de Testes e Código
Os autores apresentam o TestEvo-Bench, um benchmark ao vivo projetado para avaliar quão bem os agentes de automação de testes lidam com a co-evolução do código e dos testes. Ele aborda limitações em benchmarks existentes ao fornecer tarefas executáveis ancoradas em históricos reais de commits com configurações de ambiente.
Claude Code v2.1.235 adiciona verificação ortográfica, corrige cache de prompt e bugs na interface
A versão 2.1.235 do Claude Code introduz um recurso opcional de verificação ortográfica para a entrada de prompts e resolve vários problemas com o cache de prompts, alinhamento da interface e diálogos de permissão.
DeepSeek V4 Pro 0813 vs Claude Fable 5 no DeepSWE: Custo, Codificação e Roteamento
Uma comparação entre DeepSeek V4 Pro 0813 e Claude Fable 5 no benchmark DeepSWE revela que uma estratégia de roteamento usando ambos os modelos resolve 82,7% das tarefas a $8,28 cada, superando o uso exclusivo do Fable (69,7%) e sendo significativamente mais barata.