연구소 · Zhipu AI
media r/LocalLLaMA · 1일 전 · 조회수 1회

Anthropic 연구, GLM-5와 고급 사이버 능력 확산을 연결

Anthropic은 "GLM-5.3과 고급 사이버 능력의 확산"이라는 제목의 연구 기사를 발표했으며, GLM-5와 같은 오픈소스 모델이 악의적인 사이버 활동에 어떻게 활용되는지 조사했습니다. 기사는 이러한 모델이 위협 행위자들 사이에서 널리 채택되어 보안 커뮤니티 내에서 그들의 능력을 홍보하는 역할을 하고 있다고 강조합니다. 이 분석은 고급 AI 모델의 이중 사용 특성과 사이버 위협을 증폭시킬 잠재력에 대한 우려가 커지고 있음을 부각시킵니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

다중 턴 LLM 오염에서 인식론적 정책의 분리를 밝힌 연구

"Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation"라는 제목의 연구는 대화 기록에 주입된 거짓 전제를 대형 언어 모델이 어떻게 처리하는지 평가하며, 이는 세션 레벨 오염이라는 실패 모드로 명명됩니다. 연구자들은 GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Air를 22,500 턴의 온도 제로 조건으로 열 가지 지식 도메인에서 테스트했습니다.

arxiv arXiv cs.CL · 8일 전 · 조회수 19회

TelecomGPT-R1: 이종 Telecom 작업 전반의 추론을 위한 통합 사후 학습

연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.

arxiv arXiv cs.LG · 9일 전 HealthBench · 50.1% · 조회수 13회

Fathom-Vaidya, 기준 기반 보상으로 의료 추론 개선

저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.

arxiv arXiv cs.CL · 14일 전 · 조회수 24회

위키백과 기반 log(N)-질문 게임에서 프론티어 모델 평가

한 연구는 질문자가 N개의 위키백과 단락 중 대상 항목을 정확히 log2(N)개의 예/아니오 질문으로 식별하는 두 에이전트 간 통신 작업에서 여섯 개의 프론티어 언어 모델을 평가했습니다. 이 실험은 4~1024개 단락으로 구성된 문서 세트에서 총 408번의 게임을 진행했으며, 테스트된 모델들 간에 현저한 성능 격차를 드러냈습니다.

arxiv arXiv cs.CL · 21일 전 · 조회수 33회

GLM-5.3-Flash에 대한 단방향 공격은 MoE 모델의 안전 정렬 취약성을 드러냄

연구자들은 방향성 아블레이션(단일 방향을 가중치에서 제거하여 거부를 제거하는 화이트박스 공격)이 GLM-5.3-Flash와 같은 최전선 혼합 전문가(MoE) 모델에서도 효과적임을 입증했습니다. 이 연구는 공격이 아키텍처를 극복하지만, 그 효과가 한 곳에 집중되지 않고 어텐션, 밀집(dense), 라우팅된 전문가 작성자 전반에 분산되어 있음을 보여줍니다.