Reasoning models
arxiv arXiv cs.CL · 7시간 전 · 조회수 11회

TelecomGPT-R1: 이종 Telecom 작업 전반의 추론을 위한 통합 사후 학습

연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.

media Hugging Face Forums · 1일 전 · 조회수 10회

CosmicUndercurrent이 LLM 전체 시스템 조정을 테스트하기 위한 Principia-Structurae-Realitatis를 공개

CosmicUndercurrent은 대규모 언어 모델에서 구조적 프라이밍이 전역적 불일치를 줄일 수 있는지 테스트하도록 설계된 모델 비종속 추론 프레임워크를 오픈소스로 공개했습니다. 이 프로젝트는 호스팅되며, 두 단계 프로세스가 지역적 정확성 대비 전체 시스템 조정을 개선하는지 조사합니다.

media AI News (smol.ai) · 10일 전 · 조회수 26회

OpenAI, 1만 에이전트 협업을 통한 AI 보조 나비에-스토크스 특이점 결과 주장

OpenAI와 관련된 계정들은 AI의 도움을 받은 노력이 밀레니엄 문제 중 하나인 나비에-스토크스 존재 및 정규성 문제에 관한 결과를 산출했다고 보고했다. 이 주장은 약 10,000개의 에이전트가 다중 에이전트 강화 학습을 통해 1년 동안 훈련된 협력 시스템을 중심으로 한다.

lab NVIDIA Research · 12일 전 · 조회수 12회

ReasAlign은 추론을 통해 LLM 에이전트를 프롬프트 인젝션으로부터 방어합니다

연구자들은 대규모 언어 모델(LLM)의 간접 프롬프트 인젝션 공격에 대한 안전 정렬을 개선하도록 설계된 모델 수준의 솔루션인 ReasAlign을 소개했습니다. 이 접근 방식은 사용자 쿼리를 분석하고 상충되는 지시를 감지하여 사용자의 의도된 작업의 연속성을 보장하기 위해 구조화된 추론 단계를 통합합니다.

blog Simon Willison · 21일 전 · 조회수 40회

Anthropic, 코드 작성 및 과학 벤치마크 개선된 Claude Fable 5.1 출시

Anthropic은 코드 작성, 지식 작업, 장기 문제 해결 작업에 새로운 기준을 제시하는 모델 업데이트인 Claude Fable 5.1을 출시했습니다. 이번 릴리스는 새로운 Terminal-Bench-Science 0.1 벤치마크에서 상당한 성능 향상을 강조하며, Fable 5.1이 52.6%의 점수를 달성한 반면, Fable 5는 24.7%, Opus 5는 29.0%, GPT-5.6 Sol은 22.4%를 기록했습니다.