Grok 4.6는 일상적인 생물학적 성능을 유지하면서 바이오시큐리티 거부에서 선두
LatchBio는 Grok 4.6에 대한 BioSecBench-Refusal 및 BioSecBench-Surveillance 벤치마크에서의 독립 분석을 발표했으며, 테스트된 최전방 시스템 중 위장된 위험 과제를 거부하는 데 가장 강력한 모델임을 발견했습니다.
LatchBio는 Grok 4.6에 대한 BioSecBench-Refusal 및 BioSecBench-Surveillance 벤치마크에서의 독립 분석을 발표했으며, 테스트된 최전방 시스템 중 위장된 위험 과제를 거부하는 데 가장 강력한 모델임을 발견했습니다.
연구자들은 대규모 추론 모델(LRM)의 명시적 다단계 추론이 초래하는 높은 계산 비용을 악용하는 추론 시간 서비스 거부(PI-DoS) 공격을 공식화했다. 그들은 ReasoningBomb를 제시했는데, 이는 강화학습 기반 프레임워크로, 피해 모델을 병리적으로 길고 종종 비종료되는 추론 궤도로 몰아넣는 짧은 자연어 프롬프트를 생성하도록 공격자를 훈련시킨다.
NVIDIA는 학습이나 특징 공학 없이 컨텍스트 내 학습을 통해 작동하는 표 형식 분류 및 회귀를 위한 오픈 파운데이션 모델인 Kumo Tabular를 출시했습니다. 구조적 인과 모델에서 생성된 인공 데이터만으로 사전 훈련된 이 모델은 28M에서 215M 파라미터에 이르는 세 가지 크기로 제공됩니다.
Anthropic은 Claude 5.5 계열의 두 번째 모델인 Claude Sonnet 5.5를 출시했으며, 이는 일상적인 작업, 버그 수정, 문서 다듬기를 위해 Claude Opus 5.5보다 빠르고 비용 효율적인 보완재로 포지셔닝되었습니다.
Anthropic은 새로운 Claude 5.5 패밀리 최초의 모델인 Claude Opus 5.5를 소개했으며, 이 모델은 대부분의 작업에서 Claude Fable 5.1과 비교할 만한 성능을 발휘하면서도 Opus 5보다 실행 비용이 40% 저렴합니다.
Anthropic이 Claude Opus 5의 저비용 후속 모델인 Claude Opus 5.5를 출시했으며, 이 모델은 Artificial Analysis의 Intelligence Index v4.3과 Vals AI의 Vals Index에서 전반적인 지능 벤치마크 부문에서 선두를 차지했습니다. 동시에 OpenAI 출신 Diogo Almeida가 설립한 TypeSafe는 대규모 언어 모델보다 낮은 비용으로 텍스트를 분석하고 사전 정의된 출력을 반환하도록 설계된 일반 분류 모델인 Jev를 소개했습니다.
OpenAI는 코딩, 사실성, 컴퓨터 사용 및 전문 작업 분야의 발전을 저비용 모델에 가져옴으로써 GPT-6 Astra의 더 빠르고 저렴한 대안으로 GPT-6 Sol과 Luna를 소개했습니다.
OpenAI는 OpenAI API에서 이제 사용 가능한 두 가지 새로운 모델인 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 이 모델들은 이전에 출시된 GPT-6 Astra 아래에 위치하며, 복잡한 코딩과 대량 일상 작업에 대해 더 빠르고 저렴한 tiers로 기술적 진보를 가져오는 것을 목표로 합니다.
Anthropic은 새로운 Claude 5.5 계열의 첫 번째 모델인 Claude Opus 5.5를 출시했으며, 이는 이전 세대보다 더 효율적인 대안으로 포지셔닝되었습니다. 이 모델은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하도록 설계되었으며, Opus 5보다 실행 비용이 40% 저렴합니다.
Anthropic은 새로운 Claude 5.5 계열의 첫 번째 모델인 Claude Opus 5.5를 출시했으며, 이는 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하면서도 Opus 5보다 실행 비용이 40% 저렴합니다.
SpaceXAI는 Grok 4.6보다 더 큰 기본 모델과 확장된 강화 학습 실행을 활용하는 코딩, 에이전트 작업 및 지식 작업을 위한 새로운 플래그십 모델인 Grok 4.7을 출시했습니다. 이 모델은 전작과 동일한 가격 체계를 유지하면서도 자체 검증, 긴 컨텍스트 처리 및 안전성 측면에서 향상된 기능을 제공합니다.
OpenAI는 주요 AI 리더보드에서 상위 또는 준상위 순위를 기록하면서도 경쟁 모델에 비해 훨씬 적은 토큰을 사용하고 비용을 절감하는 새로운 플래그십 비전-언어 모델인 GPT-6 Astra를 출시했습니다. 이 모델은 OpenAI의 핵심 사이버 보안 수준을 충족하도록 설계되었으며, 고급 사이버 기능은 선택된 조직으로 제한됩니다.
OpenAI는 공식적으로 GPT-6 Astra를 출시했으며, 이를 지금까지 가장 지능적이고 정렬된 모델로 포지셔닝했습니다. 롤아웃은 컴퓨터 사용, 소프트웨어 엔지니어링, 수학 및 과학, 사무 작업, 사이버 보안을 대상으로 합니다.
OpenAI는 ChatGPT Plus, Pro, Business, Enterprise 사용자와 OpenAI API, AWS를 통해 사용할 수 있는 새로운 모델인 GPT-6 Astra를 출시했습니다. 이 모델은 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50으로 책정되어 Claude Fable 5의 경쟁자로 자리매김하고 있습니다.
Anthropic은 코딩 및 지식 작업용 새로운 플래그십 모델로 Claude Fable 5.1과 Claude Mythos 5.1을 출시했으며, 이를 자율적 다단계 작업에 대한 세계 최고 수준의 모델로 포지셔닝했습니다.
Anthropic은 코딩과 지식 작업용 새로운 플래그십 모델로 Claude Fable 5.1과 Claude Mythos 5.1을 출시했으며, 이들은 자율적이고 다단계 작업을 수행할 수 있는 능력으로 포지셔닝되었습니다. 이번 출시에는 캐시 읽기 가격이 토큰 백만 개당 $0.25로 대폭 인하되고, 1백만 토큰의 컨텍스트 창이 포함됩니다.
Anthropic은 기반 모델은 공유하지만 안전 장치 계층이 다른 Claude Fable 5.1과 제한된 Claude Mythos 5.1을 출시했습니다. Fable 5.1은 주요 클라우드 제공업체 전반에서 일반적으로 사용 가능하지만, Mythos 5.1은 검증된 조직에만 제한적으로 제공됩니다.
NVIDIA, MIT, 옥스퍼드 대학교 연구진은 captions에 자기 진화적 물리 언어를 통합하여 비디오 월드 모델을 강화하는 프레임워크인 Physis-Lang을 소개했습니다. 이 접근 방식은 물리 언어를 생성된 비디오의 물리 오류를 수정하기 위해 데이터 선별, 모델 학습 및 추론에 사용되는 최적화 가능한 표현으로 간주합니다.
AI Compute Radar는 46개의 추적 대상 오픈 모델 집합에 기여하는 15개 연구소를 대상으로 "Maker board" 랭킹을 발표했으며, 이는 Heat Score라는 복합 지표를 사용하여 산출되었습니다. 이 랭킹은 각 연구소가 상위 10위 안에 진입한 모델 수를 기준으로 하며, 동점일 경우 최고 순위와 합산된 30일 다운로드 수로 순위를 결정합니다.
Anthropic의 Frontier Red Team은 내부 Binary Exploitation 벤치마크의 100개 작업에서 중국산 모델 GLM-5.3을 평가했으며, 시도의 4%에서 완전한 제어 흐름 하이재킹을 개발할 수 있음을 발견했습니다.