Anthropic은 "GLM-5.3과 고급 사이버 능력의 확산"이라는 제목의 연구 기사를 발표했으며, GLM-5와 같은 오픈소스 모델이 악의적인 사이버 활동에 어떻게 활용되는지 조사했습니다. 기사는 이러한 모델이 위협 행위자들 사이에서 널리 채택되어 보안 커뮤니티 내에서 그들의 능력을 홍보하는 역할을 하고 있다고 강조합니다. 이 분석은 고급 AI 모델의 이중 사용 특성과 사이버 위협을 증폭시킬 잠재력에 대한 우려가 커지고 있음을 부각시킵니다.
media
r/LocalLLaMA
·
1일 전
·
open_models
Anthropic 연구, GLM-5와 고급 사이버 능력 확산을 연결
번역 English → 한국어
관련 기사
blog
Simon Willison
·
23시간 전
·
조회수 2회
Anthropic, GLM-5.3이 사이버 레드 팀에서 완전한 제어 흐름 하이재킹 달성
Anthropic의 Frontier Red Team은 내부 Binary Exploitation 벤치마크의 100개 작업에서 중국산 모델 GLM-5.3을 평가했으며, 시도의 4%에서 완전한 제어 흐름 하이재킹을 개발할 수 있음을 발견했습니다.
media
r/LocalLLaMA
·
1일 전
·
조회수 15회
Anthropic, GLM-5.3과 고급 사이버 능력의 확산 분석
Anthropic은 GLM-5.3과 고급 사이버 능력의 확산에서의 역할을 조사한 연구 논문을 발표했습니다.
arxiv
arXiv cs.CL
·
14일 전
·
조회수 24회
위키백과 기반 log(N)-질문 게임에서 프론티어 모델 평가
한 연구는 질문자가 N개의 위키백과 단락 중 대상 항목을 정확히 log2(N)개의 예/아니오 질문으로 식별하는 두 에이전트 간 통신 작업에서 여섯 개의 프론티어 언어 모델을 평가했습니다. 이 실험은 4~1024개 단락으로 구성된 문서 세트에서 총 408번의 게임을 진행했으며, 테스트된 모델들 간에 현저한 성능 격차를 드러냈습니다.
media
TLDR AI
·
34일 전
·
조회수 66회
GLM-5.3 Flash가 코딩 벤치마크에서 Claude Opus 4.8에 근접
Z.ai는 이전에 익명으로 테스트된 모델 ox-alpha가 GLM-5.3-Flash임을 밝혔습니다. 이는 320B 파라미터를 가진 Mixture of Experts (MoE) 모델이며, 18B의 활성화된 파라미터를 가지고 있습니다.
media
Together AI Blog
·
40일 전
·
조회수 77회
GLM-5.3은 DeepSWE에서 Claude Fable 5의 정확도를 비용의 5분의 1로 달성
DeepSWE 벤치마크에서의 GLM-5.3과 Claude Fable 5 비교 분석 결과, 두 모델 모두 첫 시도 정확도(69.0% 대 69.7%)에서 거의 동일한 성능을 보였으나, GLM-5.3은 비용 효율성이 현저히 높고 다중 시도 시나리오에서도 더 우수한 성능을 보였다.