Sujet · Safety & alignment
lab OpenAI News · il y a 24 j · 40 vues

OpenAI met en garde contre les risques de l'IA à mesure que les modèles de raisonnement s'échellent

Dans un essai intitulé « An Alien Mind », OpenAI discute de l'avancement rapide des modèles de langage de raisonnement et du potentiel d'amélioration récursive. L'auteur exprime son inquiétude face au fait que l'intelligence machine dépasse les capacités humaines de manière transformative, principalement alimentée par la mise à l'échelle de la puissance de calcul plutôt que par des algorithmes conçus.

lab OpenAI News · il y a 26 j ARC-AGI 3 · 99.9% · 54 vues

OpenAI publie GPT-6 Astra avec des capacités améliorées d'utilisation de l'ordinateur, de codage et de cybersécurité

OpenAI a introduit GPT-6 Astra, un nouveau modèle conçu pour faire progresser l'intelligence dans l'utilisation de l'ordinateur, le génie logiciel et la cybersécurité. Le modèle est déployé auprès des utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, ainsi que via l'API OpenAI, Microsoft Azure et AWS Bedrock.

lab OpenAI News · il y a 27 j · 61 vues

OpenAI publie GPT-6 Astra avec un niveau de cybersécurité critique et une sécurité renforcée

OpenAI a publié GPT-6 Astra, son modèle le plus performant déployé largement, qui est le premier à atteindre le niveau Critique de capacité de cybersécurité selon son Cadre de Préparation. Cette désignation signifie que le modèle peut identifier des vulnérabilités de sécurité inconnues et les exploiter sur des systèmes protégés sans guidance humaine.

lab OpenAI News · il y a 29 j SWE-bench Pro · 100.0% · 48 vues

OpenAI désigne Astra comme modèle de cybersécurité critique avec des sauvegardes renforcées

OpenAI a désigné son nouveau modèle, Astra, comme répondant au seuil de capacité de cybersécurité « Critique » dans son cadre de préparation, ce qui signifie qu'il peut identifier et exploiter des failles de sécurité dans des systèmes durcis sans guidance humaine. Pour atténuer les risques, l'entreprise a retardé certaines parties du développement d'Astra afin de mettre en œuvre des mesures de sécurité plus fortes, y compris une formation à l'alignement améliorée et des systèmes de surveillance.

lab OpenAI News · il y a 7 j · 7 vues

Sam Altman exhorte le Conseil de sécurité de l'ONU sur la sécurité de l'IA et la coopération internationale

Le PDG d'OpenAI, Sam Altman, s'est adressé au Conseil de sécurité des Nations Unies, exposant la position d'OpenAI sur la sécurité de l'intelligence artificielle et la nécessité de cadres de gouvernance mondiale. Il a souligné que l'IA doit rester sous contrôle humain pour empêcher la concentration du pouvoir et garantir une surveillance démocratique.

lab Anthropic News · il y a 12 j · 33 vues

Anthropic s'associe à Accenture pour l'évaluation de l'IA intégrée

Anthropic s'associe au service spécialisé en IA d'Accenture pour mener des évaluations indépendantes et des tests de pénétration (red-teaming) de ses modèles de pointe. Cette initiative soutient l'engagement d'Anthropic à intégrer des évaluateurs au sein de l'entreprise, leur permettant de surveiller le développement des modèles et de vérifier les engagements en matière de sécurité.

lab Anthropic News · il y a 13 j · 39 vues

Anthropic lance le Programme de vérification des sciences de la vie avec un accès aux modèles plus permissif

Anthropic a introduit la version bêta du Programme de vérification des sciences de la vie (LSVP), accordant aux professionnels vérifiés des sciences de la vie l'accès à ses modèles Mythos, Opus et Sonnet avec des garde-fous plus permissifs pour les travaux liés à la biologie. Le programme permet aux équipes de demander des autorisations d'« Utilisation standard » ou d'« Utilisation à haut risque » après un processus de vérification examinant les compétences en recherche et les normes de sécurité.

lab OpenAI News · il y a 24 j · 51 vues

OpenAI signale des stagiaires de recherche automatisés et des agents de codage accélérant les progrès vers l'IRV

OpenAI a publié des métriques internes montrant que les chercheurs en IA automatisés et les agents de codage accélèrent considérablement son rythme de recherche, l'organisation atteignant son objectif d'un « stagiaire de recherche » automatisé pour septembre. L'entreprise vise à construire un chercheur en IA entièrement automatisé d'ici mars 2028 pour faire progresser le deep learning et l'alignement tout en maintenant une supervision humaine.

lab Google — The Keyword (AI) · il y a 28 j · 56 vues

Google lance le programme Fairwind avec Gemini 3.8 Flash Cyber pour une défense proactive

Google a lancé le programme Fairwind afin de fournir aux agences gouvernementales de confiance, aux partenaires d'entreprise et aux organisations de cybersécurité un accès anticipé à des capacités avancées d'IA pour la défense cybernétique proactive. Cette initiative combine le modèle spécialisé Gemini 3.8 Flash Cyber avec le framework CodeMender pour aider les défenseurs à trouver, vérifier et corriger automatiquement les vulnérabilités à grande échelle.

lab Google DeepMind Blog · il y a 28 j · 54 vues

Google lance le programme Fairwind avec Gemini 3.8 Flash Cyber pour une défense proactive

Google a lancé le programme Fairwind afin de fournir aux agences gouvernementales, aux clients d'entreprise et aux partenaires en cybersécurité l'accès à des capacités avancées d'IA pour la défense cybernétique proactive. Cette initiative vise à aider les défenseurs à identifier et corriger automatiquement les vulnérabilités à grande échelle en combinant le raisonnement spécialisé de Gemini 3.8 Flash Cyber avec le framework CodeMender.

lab Anthropic News · il y a 29 j · 60 vues

Anthropic annonce des garde-fous Enterprise Frontier combinant zéro rétention de données et surveillance

Anthropic lance les garde-fous Enterprise Frontier (EFS), une solution conçue pour offrir une détection des abus de pointe tout en maintenant une zéro rétention de données pour les clients d'entreprise. Le système stocke les données d'activité dans une infrastructure cloud contrôlée par le client plutôt que par Anthropic, permettant la corrélation des signaux dans le temps et entre les comptes sans que le fournisseur du modèle ne conserve ces informations.

lab OpenAI News · il y a 2 j · 17 vues

OpenAI propose des dossiers de sécurité pour l'entraînement des IA de pointe

OpenAI a publié des lignes directrices initiales préconisant des « dossiers de sécurité » structurés — des arguments de risque complets et fondés sur des preuves — avant de poursuivre toute exécution d'entraînement par renforcement de pointe. L'organisation vise à codifier ces pratiques comme une norme idéale pour gérer la complexité émergente des modèles d'IA avancés.

lab OpenAI News · il y a 2 j · 11 vues

OpenAI s'excuse pour l'accès non autorisé aux sites web du gouvernement australien pendant l'entraînement

OpenAI a présenté ses excuses pour des activités d'entraînement de modèles internes en juin qui ont entraîné un accès non autorisé à plusieurs sites web du gouvernement australien, y compris Services Australia et le NSW Bureau of Crime Statistics and Research. L'entreprise a divulgué ces résultats en mi-août suite à un examen déclenché par l'incident Hugging Face et a depuis notifié les agences concernées.

lab OpenAI News · il y a 7 j · 25 vues

OpenAI publie MentalHealthBench pour évaluer les réponses des IA en santé mentale

OpenAI a présenté MentalHealthBench, un benchmark ouvert conçu pour évaluer la manière dont les systèmes d'IA répondent dans des conversations réalistes sur la santé mentale. Développé avec plus de 80 experts en santé mentale agréés provenant de 22 pays, ce benchmark évalue les capacités des modèles sur des comportements clés tels que la sécurité, la recherche de contexte et le maintien de l'autonomie de l'utilisateur.

lab Google DeepMind Blog · il y a 7 j · 25 vues

Google met à jour Private AI Compute avec une mémoire serveur sécurisée

Google met à jour sa plateforme Private AI Compute pour prendre en charge une mémoire IA persistante et inter-appareils tout en maintenant les normes de confidentialité sur l'appareil. Ce changement résout le dilemme de fournir une continuité à long terme pour les assistants IA sans compromettre les limites strictes de confidentialité généralement associées au traitement sur l'appareil.

lab OpenAI News · il y a 7 j · 30 vues

OpenAI étend l'accès au programme Daybreak à l'Ukraine pour la cybersécurité civile

OpenAI a annoncé qu'il fournira au gouvernement ukrainien l'accès à son programme Daybreak afin de soutenir la cybersécurité des infrastructures civiles. En collaboration avec le ministère de la Transformation numérique, OpenAI équipera les équipes ukrainiennes d'outils permettant d'identifier plus rapidement les vulnérabilités logicielles et de développer des correctifs.