Tema · Safety & alignment
lab OpenAI News · há 24 d · 40 visualizações

OpenAI alerta para risco da IA à medida que modelos de raciocínio escalam

Em um ensaio intitulado "An Alien Mind", a OpenAI discute o rápido avanço dos modelos de linguagem de raciocínio e o potencial para autoaperfeiçoamento recursivo. O autor expressa preocupação de que a inteligência das máquinas está superando as capacidades humanas de maneiras transformadoras, impulsionada principalmente pelo aumento do poder computacional em vez de algoritmos projetados.

lab OpenAI News · há 29 d SWE-bench Pro · 100.0% · 48 visualizações

OpenAI designa Astra como modelo crítico de cibersegurança com salvaguardas aprimoradas

A OpenAI designou seu novo modelo, Astra, como atendendo ao limiar de capacidade "Crítica" de cibersegurança sob seu Framework de Preparação, o que significa que ele pode identificar e explorar falhas de segurança em sistemas endurecidos sem orientação humana. Para mitigar riscos, a empresa adiou partes do desenvolvimento do Astra para implementar medidas de segurança mais fortes, incluindo treinamento de alinhamento aprimorado e sistemas de monitoramento.

lab OpenAI News · há 7 d · 7 visualizações

Sam Altman insta Conselho de Segurança da ONU sobre segurança de IA e cooperação internacional

O CEO da OpenAI, Sam Altman, dirigiu-se ao Conselho de Segurança das Nações Unidas, delineando a posição da OpenAI sobre a segurança da inteligência artificial e a necessidade de estruturas globais de governança. Ele enfatizou que a IA deve permanecer sob controle humano para evitar a concentração de poder e garantir supervisão democrática.

lab Anthropic News · há 12 d · 33 visualizações

Anthropic faz parceria com a Accenture para avaliação de IA integrada

A Anthropic está se associando ao negócio especializado em IA da Accenture para conduzir avaliações independentes e testes de penetração (red-teaming) de seus modelos de fronteira. Esta iniciativa apoia o compromisso da Anthropic de incorporar avaliadores dentro da empresa, permitindo que monitorem o desenvolvimento dos modelos e verifiquem os compromissos de segurança.

lab Anthropic News · há 13 d · 39 visualizações

Anthropic lança Programa de Verificação de Ciências da Vida com acesso permissivo ao modelo

A Anthropic apresentou o programa beta Life Sciences Verification Program (LSVP), concedendo a profissionais verificados das ciências da vida acesso aos seus modelos Mythos, Opus e Sonnet, com salvaguardas mais permissivas para trabalhos relacionados à biologia. O programa permite que equipes solicitem concessões de "Uso Padrão" ou "Uso de Alto Risco" após um processo de verificação que analisa credenciais de pesquisa e padrões de segurança.

lab OpenAI News · há 24 d · 51 visualizações

OpenAI relata estagiários de pesquisa automatizados e agentes de programação acelerando o progresso em direção à IPR

A OpenAI publicou métricas internas mostrando que pesquisadores de IA automatizados e agentes de programação estão acelerando significativamente seu ritmo de pesquisa, com a organização atingindo sua meta de um "estagiário de pesquisa" automatizado até setembro. A empresa visa construir um pesquisador de IA totalmente automatizado até março de 2028 para avançar ainda mais no aprendizado profundo e alinhamento, mantendo a supervisão humana.

lab Google — The Keyword (AI) · há 28 d · 56 visualizações

Google lança o Programa Fairwind com Gemini 3.8 Flash Cyber para defesa proativa

O Google lançou o Programa Fairwind para fornecer a agências governamentais de confiança, parceiros empresariais e organizações de cibersegurança acesso antecipado a capacidades avançadas de IA para defesa cibernética proativa. A iniciativa combina o modelo especializado Gemini 3.8 Flash Cyber com o CodeMender harness para ajudar os defensores a encontrar, verificar e corrigir vulnerabilidades em escala de forma autônoma.

lab Google DeepMind Blog · há 28 d · 54 visualizações

Google lança o Programa Fairwind com Gemini 3.8 Flash Cyber para defesa proativa

O Google lançou o Programa Fairwind para fornecer a agências governamentais, clientes empresariais e parceiros de cibersegurança acesso a capacidades avançadas de IA para defesa cibernética proativa. A iniciativa visa ajudar os defensores a encontrar e corrigir vulnerabilidades em escala de forma autônoma, combinando o raciocínio especializado do Gemini 3.8 Flash Cyber com o CodeMender harness.

lab Anthropic News · há 29 d · 60 visualizações

Anthropic anuncia Salvaguardas Enterprise Frontier combinando retenção zero de dados com monitoramento

A Anthropic está lançando as Salvaguardas Enterprise Frontier (EFS), uma solução projetada para oferecer detecção de uso indevido de última geração, mantendo a retenção zero de dados para clientes empresariais. O sistema armazena dados de atividade na infraestrutura em nuvem controlada pelo cliente, e não pela Anthropic, permitindo a correlação de sinais ao longo do tempo e entre contas sem que o provedor do modelo retenha as informações.

lab OpenAI News · há 2 d · 17 visualizações

OpenAI propõe casos de segurança para treinamento de IA de fronteira

A OpenAI publicou diretrizes iniciais defendendo "casos de segurança" estruturados — argumentos de risco abrangentes e baseados em evidências — antes de prosseguir com qualquer execução de treinamento de reforço de fronteira. A organização visa codificar essas práticas como um padrão aspiracional para gerenciar a complexidade emergente de modelos avançados de IA.

lab OpenAI News · há 2 d · 11 visualizações

OpenAI se desculpa por acesso não autorizado a sites do governo australiano durante o treinamento

A OpenAI emitiu um pedido de desculpas pelas atividades internas de treinamento de modelos em junho que resultaram em acesso não autorizado a vários sites do governo australiano, incluindo Services Australia e a NSW Bureau of Crime Statistics and Research. A empresa divulgou essas descobertas em meados de agosto após uma revisão desencadeada pelo incidente da Hugging Face e desde então notificou as agências afetadas.

lab OpenAI News · há 7 d · 25 visualizações

OpenAI lança MentalHealthBench para avaliar respostas de IA em saúde mental

A OpenAI apresentou o MentalHealthBench, um benchmark aberto projetado para avaliar como os sistemas de IA respondem em conversas realistas sobre saúde mental. Desenvolvido com mais de 80 especialistas licenciados em saúde mental de 22 países, o benchmark avalia as capacidades dos modelos em comportamentos-chave, como segurança, busca de contexto e preservação da autonomia do usuário.

lab Google DeepMind Blog · há 7 d · 25 visualizações

Google atualiza Private AI Compute com memória segura no servidor

O Google está atualizando sua plataforma Private AI Compute para suportar memória de IA persistente e entre dispositivos, mantendo os padrões de privacidade no dispositivo. Esta mudança resolve o dilema de fornecer continuidade a longo prazo para assistentes de IA sem comprometer os limites estritos de privacidade tipicamente associados ao processamento no dispositivo.