주제 · Benchmark results
lab NVIDIA Research · 19일 전 · 조회수 21회

ReasoningBomb는 대규모 추론 모델에서 병리적으로 긴 추론을 유도한다

연구자들은 대규모 추론 모델(LRM)의 명시적 다단계 추론이 초래하는 높은 계산 비용을 악용하는 추론 시간 서비스 거부(PI-DoS) 공격을 공식화했다. 그들은 ReasoningBomb를 제시했는데, 이는 강화학습 기반 프레임워크로, 피해 모델을 병리적으로 길고 종종 비종료되는 추론 궤도로 몰아넣는 짧은 자연어 프롬프트를 생성하도록 공격자를 훈련시킨다.

lab Hugging Face Blog · 1일 전 · 조회수 8회

NVIDIA가 제로샷 표 형식 예측을 위한 오픈 Kumo Tabular 파운데이션 모델을 출시

NVIDIA는 학습이나 특징 공학 없이 컨텍스트 내 학습을 통해 작동하는 표 형식 분류 및 회귀를 위한 오픈 파운데이션 모델인 Kumo Tabular를 출시했습니다. 구조적 인과 모델에서 생성된 인공 데이터만으로 사전 훈련된 이 모델은 28M에서 215M 파라미터에 이르는 세 가지 크기로 제공됩니다.

media The Batch · 5일 전 Humanity's Last Exam · 61.4% · 조회수 11회

Anthropic, Claude Opus 5.5 출시; TypeSafe, Jev 분류 모델 발표

Anthropic이 Claude Opus 5의 저비용 후속 모델인 Claude Opus 5.5를 출시했으며, 이 모델은 Artificial Analysis의 Intelligence Index v4.3과 Vals AI의 Vals Index에서 전반적인 지능 벤치마크 부문에서 선두를 차지했습니다. 동시에 OpenAI 출신 Diogo Almeida가 설립한 TypeSafe는 대규모 언어 모델보다 낮은 비용으로 텍스트를 분석하고 사전 정의된 출력을 반환하도록 설계된 일반 분류 모델인 Jev를 소개했습니다.

media MarkTechPost · 8일 전 GDPval-AA (Elo) · 1695.0Elo · 조회수 23회

SpaceXAI가 더 큰 기본 모델과 향상된 벤치마크를 갖춘 Grok 4.7 출시

SpaceXAI는 Grok 4.6보다 더 큰 기본 모델과 확장된 강화 학습 실행을 활용하는 코딩, 에이전트 작업 및 지식 작업을 위한 새로운 플래그십 모델인 Grok 4.7을 출시했습니다. 이 모델은 전작과 동일한 가격 체계를 유지하면서도 자체 검증, 긴 컨텍스트 처리 및 안전성 측면에서 향상된 기능을 제공합니다.

media The Batch · 19일 전 GPQA Diamond · 96.3% · 조회수 32회

OpenAI가 GPT-6 Astra 출시, 낮은 비용으로 리더보드 정상 등극

OpenAI는 주요 AI 리더보드에서 상위 또는 준상위 순위를 기록하면서도 경쟁 모델에 비해 훨씬 적은 토큰을 사용하고 비용을 절감하는 새로운 플래그십 비전-언어 모델인 GPT-6 Astra를 출시했습니다. 이 모델은 OpenAI의 핵심 사이버 보안 수준을 충족하도록 설계되었으며, 고급 사이버 기능은 선택된 조직으로 제한됩니다.

media AI News (smol.ai) · 29일 전 · 조회수 50회

Anthropic, 캐시 가격 인하된 Claude Fable 5.1 및 Mythos 5.1 출시

Anthropic은 코딩과 지식 작업용 새로운 플래그십 모델로 Claude Fable 5.1과 Claude Mythos 5.1을 출시했으며, 이들은 자율적이고 다단계 작업을 수행할 수 있는 능력으로 포지셔닝되었습니다. 이번 출시에는 캐시 읽기 가격이 토큰 백만 개당 $0.25로 대폭 인하되고, 1백만 토큰의 컨텍스트 창이 포함됩니다.

media MarkTechPost · 29일 전 GDPval-AA (Elo) · 1853.0Elo · 조회수 53회

Anthropic, Terminal-Bench-Science에서 52.6% 점수 및 저렴한 캐시 읽기와 함께 Claude Fable 5.1 출시

Anthropic은 기반 모델은 공유하지만 안전 장치 계층이 다른 Claude Fable 5.1과 제한된 Claude Mythos 5.1을 출시했습니다. Fable 5.1은 주요 클라우드 제공업체 전반에서 일반적으로 사용 가능하지만, Mythos 5.1은 검증된 조직에만 제한적으로 제공됩니다.

media MarkTechPost · 7시간 전

NVIDIA 연구진, Cosmos 3 비디오 모델의 물리 추론 개선을 위해 Physis-Lang 공개

NVIDIA, MIT, 옥스퍼드 대학교 연구진은 captions에 자기 진화적 물리 언어를 통합하여 비디오 월드 모델을 강화하는 프레임워크인 Physis-Lang을 소개했습니다. 이 접근 방식은 물리 언어를 생성된 비디오의 물리 오류를 수정하기 위해 데이터 선별, 모델 학습 및 추론에 사용되는 최적화 가능한 표현으로 간주합니다.

media Hugging Face Forums · 10시간 전

AI Compute Radar가 Heat Score로 알리바바 Qwen과 구글을 최상위 오픈 모델 연구소로 평가

AI Compute Radar는 46개의 추적 대상 오픈 모델 집합에 기여하는 15개 연구소를 대상으로 "Maker board" 랭킹을 발표했으며, 이는 Heat Score라는 복합 지표를 사용하여 산출되었습니다. 이 랭킹은 각 연구소가 상위 10위 안에 진입한 모델 수를 기준으로 하며, 동점일 경우 최고 순위와 합산된 30일 다운로드 수로 순위를 결정합니다.