출처 · arXiv cs.CL
arxiv arXiv cs.CL · 28일 전 · 조회수 35회

NVIDIA Nemotron-3 모델, IOI 코딩 대회에서 금메달급 성능 달성

NVIDIA는 경쟁 프로그래밍에서 뛰어난 성과를 거두기 위해 Nemotron-3-Nano-CC 및 Nemotron-3-Ultra-CC 언어 모델용 사후 학습 파이프라인을 개발했습니다. 대규모 문제 큐레이션, 합성 추론 트레이스, 지도 미세 조정(SFT) 및 강화 학습(RL)을 결합하여 팀은 고급 알고리즘적 추론이 가능한 전문 시스템을 구축했습니다.

arxiv arXiv cs.CL · 17시간 전 · 조회수 1회

컨텍스트 언어 모델은 컨텍스트를 편집 가능한 파일로 네이티브하게 관리합니다

연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

다중 턴 LLM 오염에서 인식론적 정책의 분리를 밝힌 연구

"Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation"라는 제목의 연구는 대화 기록에 주입된 거짓 전제를 대형 언어 모델이 어떻게 처리하는지 평가하며, 이는 세션 레벨 오염이라는 실패 모드로 명명됩니다. 연구자들은 GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Air를 22,500 턴의 온도 제로 조건으로 열 가지 지식 도메인에서 테스트했습니다.

arxiv arXiv cs.CL · 2일 전 SWE-bench Verified · 49.2% · 조회수 1회

ROFT는 자체 생성 설명에 대한 파인튜닝으로 에이전트 모델을 개선합니다

연구자들은 Retrospection-Only Fine-Tuning (ROFT)를 조사하고 있습니다. 이는 에이전트가 자신의 경험에 대한 회고적 설명을 생성하고 해당 설명 토큰의 다음 토큰 예측 손실만을 사용하여 파인튜닝되는 최소한의 온라인 절차입니다. 이 방법에는 외부 교사나 보상 기반 정책 업데이트가 필요하지 않습니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

Rep2Act가 새로운 VAD-R 벤치마크에서 기권 능력을 향상시키기 위해 VLM 표현을 정렬

연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.

arxiv arXiv cs.CL · 3일 전 · 조회수 6회

Highlight-Then-Summarize는 더 나은 긴 문맥 이해를 위해 증거를 압축한다

연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 압축된 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안했다. 이 접근 방식을 지원하기 위해 연구진은 11개 벤치마크 패밀리에서 6,647개의 예제를 포함한 H2S-Dataset을 구축하고 프로세스 수준 보상을 위한 H2S-RL을 도입했다.

arxiv arXiv cs.CL · 3일 전 · 조회수 7회

KuaFu는 수십억 규모에서 사용자 행동을 이해로 압축합니다

Tencent는 원시 사용자 기록을 대화 에이전트 및 추천 시스템용 컴팩트한 표현으로 압축하는 통합 행동 압축 레이어인 KuaFu를 소개했습니다. 이 시스템은 2축 프로젝터를 사용하여 각 행동 항목을 너비 128-256의 2-4개 토큰으로 압축하여 수십억 사용자의 긴 시퀀스 처리 병목을 해결합니다.

arxiv arXiv cs.CL · 6일 전 · 조회수 9회

코루틴-브리지 하니스가 CAR-bench 트랙 2에서 60.0% Pass^3로 우승

도구 사용 에이전트를 위한 새로운 코루틴-브리지 하니스가 CAR-bench 평가의 트랙 2를 우승했으며, 공식 숨겨진 테스트 세트에서 60.0%의 Pass@3 점수를 달성했습니다. 이 시스템은 모델이 평가자 간 교환을 가로질러 차단하고 재개하는 Python 프로그램을 생성하도록 함으로써 모델 호출과 도구 왕복을 분리합니다.

arxiv arXiv cs.CL · 7일 전 · 조회수 8회

VHD-Play는 해결된 메커니즘에서 에이전트형 RL 환경을 생성합니다

VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.

arxiv arXiv cs.CL · 7일 전 · 조회수 2회

WebMRE 벤치마크는 웹 에이전트에서 가이드-액션 상호 보강을 드러낸다

저자들은 WebMRE를 소개한다. 이는 성공적인 WebArena 트래젝토리에서 파생된 541개의 작업과 5,293개의 스텝으로 구성된 오프라인 벤치마크로, 환경 드리프트 없이 웹 에이전트 체크포인트를 평가하기 위한 결정론적 프로토콜을 제공하도록 설계되었다. 이 프레임워크는 인간 중심의 가이드 문장과 지상화된 액션을 짝지어 두 요소 간 상호 보강 효과를 연구한다.

arxiv arXiv cs.CL · 7일 전 SWE-Lancer · 51.47% · 조회수 10회

SkillGym이 LLM에 인간 기술을 내재화하여 현실 문제 해결을 가능하게 함

연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.

arxiv arXiv cs.CL · 8일 전 · 조회수 19회

TelecomGPT-R1: 이종 Telecom 작업 전반의 추론을 위한 통합 사후 학습

연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.

arxiv arXiv cs.CL · 9일 전 · 조회수 15회

AgentRouter가 단계별 모델 라우팅을 통해 에이전트 워크플로우 비용을 72% 절감

연구자들은 AgentRouter를 제안했는데, 이는 단일 최첨단 모델을 모든 작업에 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하여 다단계 에이전트 워크플로우를 최적화하는 경량 분류기입니다. 이 시스템은 더 작은 모델로도 충분히 처리할 수 있는 하위 작업에 추론 예산의 60-80%를 낭비하는 기업 시스템의 비효율성을 해결합니다.

arxiv arXiv cs.CL · 10일 전 · 조회수 17회

NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시

NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.