O Sistema Buddy usa um monitor de entropia Rust para detectar a incerteza por token na inferência local do Gemma 3 4B, roteando apenas tokens incertos para o Sonnet por meio de extração de span com gate NER e recuperação semântica. Os benchmarks mostram que ele alcança 71,4% de precisão por $0,21, superando o padrão Anthropic Advisor (62,9% por $0,44) em sete conjuntos de dados do Hugging Face, com uma melhoria chave no SQuAD v2 ao rotear trechos de passagem de origem para o modelo na nuvem.
Sistema Buddy: Monitor de entropia Rust com incerteza gated por NER para inferência LLM em camadas
Gradio lança Workflow1111, reconstruindo recursos do AUTOMATIC1111 como um grafo Gradio
O Gradio lançou o Workflow1111, um projeto que reconstrói a maioria do conjunto de recursos do stable-diffusion-webui do AUTOMATIC1111 usando o framework gr.Workflow. O aplicativo consiste em uma única tela contendo onze pipelines de mídia construídos a partir de setenta e três nós, abrangendo texto-para-imagem, imagem-para-vídeo e várias tarefas de pré-processamento.
Modelo de Música IA roda em tempo real na maioria das CPUs no navegador
O NanoMaestro Realtime é um modelo de música IA de 50MB com 13M de parâmetros que gera música de piano em tempo real usando uma LSTM de 2 camadas. Ele roda localmente no navegador via ONNX e Transformers.js com WASM, não requer GPU ou backend de servidor, e funciona em modelos mais antigos do Raspberry Pi.
GPT-5.5 Instant melhora as respostas de saúde do ChatGPT
O GPT-5.5 Instant melhora as respostas de saúde e bem-estar do ChatGPT por meio de raciocínio mais forte, melhor manejo de contexto, comunicação mais clara e avaliações informadas por médicos.
Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
A Anthropic lançou dois novos modelos de linguagem grandes, Claude Opus 4 e Claude Sonnet 4, que introduzem capacidades de "raciocínio híbrido" para combinar respostas rápidas com pensamento passo a passo estendido. Esses modelos sucedem a geração Claude 3.x e mantêm uma janela de contexto de 200.000 tokens, ao mesmo tempo que oferecem melhorias na segurança e nas capacidades agênticas.
Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
O Google lançou o Gemini 2.5 Pro, seu primeiro modelo da família Gemini 2.5 e o modelo de raciocínio mais capaz até o momento. O modelo possui uma janela de contexto de entrada de 1 milhão de tokens (com planos de expansão), suporta entradas multimodais incluindo texto, imagem, áudio e vídeo, e está atualmente disponível por meio do plano Gemini Advanced e do Google AI Studio.