OpenAI, GPT-6 Sol과 Luna를 출시하며 API 가격을 50% 인하
OpenAI는 OpenAI API에서 이제 사용 가능한 두 가지 새로운 모델인 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 이 모델들은 이전에 출시된 GPT-6 Astra 아래에 위치하며, 복잡한 코딩과 대량 일상 작업에 대해 더 빠르고 저렴한 tiers로 기술적 진보를 가져오는 것을 목표로 합니다.
OpenAI는 OpenAI API에서 이제 사용 가능한 두 가지 새로운 모델인 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 이 모델들은 이전에 출시된 GPT-6 Astra 아래에 위치하며, 복잡한 코딩과 대량 일상 작업에 대해 더 빠르고 저렴한 tiers로 기술적 진보를 가져오는 것을 목표로 합니다.
Anthropic은 새로운 Claude 5.5 계열의 첫 번째 모델인 Claude Opus 5.5를 출시했으며, 이는 이전 세대보다 더 효율적인 대안으로 포지셔닝되었습니다. 이 모델은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하도록 설계되었으며, Opus 5보다 실행 비용이 40% 저렴합니다.
Anthropic은 새로운 Claude 5.5 계열의 첫 번째 모델인 Claude Opus 5.5를 출시했으며, 이는 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하면서도 Opus 5보다 실행 비용이 40% 저렴합니다.
영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.
SpaceXAI는 Grok 4.6보다 더 큰 기본 모델과 확장된 강화 학습 실행을 활용하는 코딩, 에이전트 작업 및 지식 작업을 위한 새로운 플래그십 모델인 Grok 4.7을 출시했습니다. 이 모델은 전작과 동일한 가격 체계를 유지하면서도 자체 검증, 긴 컨텍스트 처리 및 안전성 측면에서 향상된 기능을 제공합니다.
저자는 오픈웨이트 모델의 현황에 대한 브리핑을 제시하며, 약 2025년 4월 이후 중국 AI 기업들이 이 분야에서 명확한 선두주자가 되었음을 지적합니다. 이러한 변화는 Hugging Face 다운로드 지표와 능력 벤치마크에서의 성과로 입증됩니다.
에이전트 폐기 지수는 루프, 무작위 재시도, 과다한 도구 출력, 중단된 실행과 같은 비효율성을 식별하기 위해 11개 공개 데이터셋에서 341,054개 에이전트 궤적을 점수화했습니다. 분석 결과, 루프 및 재시도 행동은 Llama 에이전트와 같은 약한 모델에서 흔하지만 Claude 3.7 Sonnet과 Qwen3-Coder-480B에서는 드뭅니다.
모질라의 보고서에 따르면 중국의 오픈 가중치 AI 모델은 미국 프론티어 제품에 비해 개발 격차가 단 4개월로 좁혀졌습니다. 이러한 빠른 진전에도 불구하고 모델들은 일부 벤치마크 평가에서 여전히 뒤처지고 있습니다.
Qwen3.8 Max (0902) 모델은 Artificial Analysis 지능 지수에서 45점을 달성하여 중국 리더보드에서 정상 자리를 되찾았습니다.
Prior Labs는 데이터셋별 학습이나 튜닝 없이 단일 순전파로 테이블에서 예측하는 표형 파운데이션 모델인 TabPFN-3.5를 출시했습니다. 이 모델은 2015 오토 그룹 제품 분류 챌린지의 프라이빗 리더보드에서 0.375점을 기록하며, Gilberto Titericz와 Stanislav Semenov가 달성한 원래 우승 점수 0.382를 앞섰습니다.
모질라의 보고서에 따르면 중국과 미국의 인공지능 모델 간 능력 격차가 크게 축소되어 4.4개월의 차이로 줄어듦을 나타냅니다.
Nums AI는 분류 및 회귀를 위한 사전 학습된 표형 파운데이션 모델인 Causilo를 출시했으며, 이 모델은 TabArena에서 단일 모델 중 가장 높은 Elo 점수를 달성했습니다. 이 모델은 가중치를 업데이트하는 대신 훈련 행을 컨텍스트로 저장하는 인컨텍스트 학습 방식을 활용하며, Apache-2.0 라이선스 하에 Hugging Face에서 코드와 사전 학습된 가중치를 제공합니다.
Stellar Colosseum은 모델 독립적 하네스로, 복잡한 문제에서 언어 모델의 신뢰성 부족 문제를 해결하며 수학 및 이론 컴퓨터 과학 분야의 장기 연구 전반에 추론 작업을 분배하도록 설계되었습니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 통해 경로가 분해에 충분히 성숙했는지 판단하며, 증명 계획을 상호 의존적인 섹션 수준의 하위 문제로 표현합니다.
저자들은 Stellar Colosseum을 소개합니다. 이는 수학 및 이론 컴퓨터 과학 분야의 장기 연구에 추론을 할당하도록 설계된 모델 비종속 하니스입니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 사용하여 경로가 분해에 충분히 성숙한 시점을 결정하며, 증명 계획을 상호의존적인 섹션 수준의 하위 문제로 표현합니다.
Base-10의 찰리 오닐은 Dwarkesh Patel과의 최근 에피소드에서 Kimi와 GLM 모델이 "거의 객관적으로" Opus 5보다 우수하다고 논의했습니다.
광범위하게 사용되는 여섯 가지 물리 벤치마크를 감사한 연구에 따르면, 최첨단 언어 모델의 보고된 낮은 점수는 모델의 결함보다는 벤치마킹 오류로 인해 주로 발생했다. 전문가들은 문제 진술, 참조 솔루션 및 모델 응답을 검토하여 실제 오류와 채점자의 실수, 잘못된 참조, 모호한 질문을 구분했다.
DeepSeek V4.1 Flash가 Artificial Analysis Intelligence Index v4.3 업데이트의 새로운 Astra 벤치마크에서 1위를 차지했습니다.
Cohere는 CC BY-NC 4.0 라이선스 하에 연구 및 비상업적 용도로 사용할 수 있는 North 시리즈의 첫 번째 번역 모델인 North Small Translate를 출시했습니다. 이 mixture-of-experts 모델은 WMT26 All Languages 벤치마크에서 83.6점을 기록하여 DeepL NextGen과 Google Translate와 같은 독점 모델을 능가합니다.
Cognition은 Moonshot AI의 2.8T 파라미터 오픈 모델인 Kimi K3를 강화학습으로 사후 학습한 가장 뛰어난 코딩 모델 SWE-2를 출시했습니다. 이 모델은 FrontierCode 1.1 Main에서 50.0%의 점수를 기록했으며, 비용은 64% 절감하면서 Fable 5.1과 단 한 점 차이로 경쟁하고 있습니다.
연구자들은 대규모 추론 모델(LRM)의 명시적 다단계 추론이 초래하는 높은 계산 비용을 악용하는 추론 시간 서비스 거부(PI-DoS) 공격을 공식화했다. 그들은 ReasoningBomb를 제시했는데, 이는 강화학습 기반 프레임워크로, 피해 모델을 병리적으로 길고 종종 비종료되는 추론 궤도로 몰아넣는 짧은 자연어 프롬프트를 생성하도록 공격자를 훈련시킨다.