Le Système de parrainage utilise un moniteur d'entropie Rust pour détecter l'incertitude par token dans l'inférence locale Gemma 3 4B, en acheminant uniquement les tokens incertains vers Sonnet via l'extraction de span à porte NER et la récupération sémantique. Les benchmarks montrent qu'il atteint une précision de 71,4 % à 0,21 $, surpassant le modèle Anthropic Advisor (62,9 % à 0,44 $) sur sept ensembles de données Hugging Face, avec une amélioration clé sur SQuAD v2 en acheminant les chunks de passage source vers le modèle cloud.
Système de parrainage : moniteur d'entropie Rust avec incertitude à porte NER pour l'inférence LLM par niveau
Gradio publie Workflow1111, reconstruisant les fonctionnalités d'AUTOMATIC1111 sous forme de graphe Gradio
Gradio a publié Workflow1111, un projet qui reconstruit la plupart des fonctionnalités de stable-diffusion-webui d'AUTOMATIC1111 en utilisant le framework gr.Workflow. L'application se compose d'un seul canevas contenant onze pipelines multimédias construits à partir de soixante-treize nœuds, couvrant la génération d'images à partir de texte, la vidéo à partir d'images et diverses tâches de prétraitement.
Un modèle de musique IA fonctionne en temps réel sur la plupart des CPU dans le navigateur
NanoMaestro Realtime est un modèle de musique IA de 50 Mo avec 13 M de paramètres qui génère de la musique de piano en temps réel à l'aide d'un LSTM à 2 couches. Il s'exécute localement dans le navigateur via ONNX et Transformers.js avec WASM, ne nécessitant ni GPU ni backend serveur, et fonctionne sur les anciens modèles de Raspberry Pi.
GPT-5.5 Instant améliore les réponses de santé de ChatGPT
GPT-5.5 Instant améliore les réponses de santé et bien-être de ChatGPT grâce à un raisonnement plus robuste, une meilleure gestion du contexte, une communication plus claire et des évaluations informées par des médecins.
Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
Anthropic a publié deux nouveaux grands modèles de langage, Claude Opus 4 et Claude Sonnet 4, qui introduisent des capacités de « raisonnement hybride » pour fusionner des réponses rapides avec une réflexion étape par étape prolongée. Ces modèles succèdent à la génération Claude 3.x et conservent une fenêtre de contexte de 200 000 tokens tout en offrant une sécurité améliorée et des capacités agentic.
Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
Google a publié Gemini 2.5 Pro, son premier modèle de la famille Gemini 2.5 et le modèle de raisonnement le plus performant à ce jour. Le modèle dispose d'une fenêtre de contexte d'entrée de 1 million de tokens (avec des plans d'expansion), prend en charge les entrées multimodales incluant texte, image, audio et vidéo, et est actuellement disponible via l'abonnement Gemini Advanced et Google AI Studio.