llama.cpp b10306이 SYCL GLU 평탄 경로 추가 및 커널 통합
llama.cpp b10306 릴리스는 게이트드 리니어 유닛(GLU) 연산을 대상으로 하는 SYCL 백엔드의 성능 최적화를 도입합니다. 이 업데이트는 융합된 GLU 연산에 대한 연속적인 고속 경로를 추가하고, 이전에 별개였던 커널을 통합하여 공통 런처를 공유하도록 합니다.
llama.cpp b10306 릴리스는 게이트드 리니어 유닛(GLU) 연산을 대상으로 하는 SYCL 백엔드의 성능 최적화를 도입합니다. 이 업데이트는 융합된 GLU 연산에 대한 연속적인 고속 경로를 추가하고, 이전에 별개였던 커널을 통합하여 공통 런처를 공유하도록 합니다.
llama.cpp b10255 릴리스는 Q4_0–Q8_0 양자화된 포맷과 FP32를 포함하여 비FP16 키-값(KV) 캐시를 지원하도록 oneDNN SDPA 경로를 확장합니다. 이 업데이트는 K/V 텐서를 처리하기 전에 온디바이스에서 디쿼티징하거나 밀집 FP16으로 변환함으로써 융합된 systolic 커널이 네이티브 FP16 경로와 동일하게 실행되도록 합니다.
Lucebox는 Nvidia DGX Spark보다 추론 속도가 뛰어난 이종 소비자 하드웨어 구성을 시연하기 위해 AMD와 파트너십을 맺었습니다. 이 시스템은 전체 284B DeepSeek V4 Flash 모델을 실행하기 위해 AMD Radeon AI PRO R9700 GPU와 Strix Halo 프로세서를 결합합니다.
본 기사는 엔터프라이즈 AI에서 모델의 지능보다 GPU 활용도가 주요 제약 조건으로 부상했으며, 이는 사용 여부와 상관없이 시간당 비용이 발생한다는 항공기 활용도와 유사하다고 주장합니다.
페이선스 스트롱은 현재 신경망이 소프트웨어에서 회로를 에뮬레이션하는 대신 물리적 하드웨어로 구현함으로써 과도한 컴퓨팅 파워를 소비한다고 주장합니다. 논문에서는 이 에뮬레이션을 가중치와 바이어스가 비휘발성 메모리에 저장되는 반도체 소자로 대체할 것을 제안합니다.
Ai2는 지구 관측 파운데이션 모델을 파인튜닝부터 대규모 추론까지 처리하도록 설계된 인프라 시스템인 OlmoEarth 플랫폼을 출시했습니다. 이 플랫폼은 여러 공급자와 해상도에서 테라바이트 규모의 다중 모달 위성 데이터를 처리하는 공학적 과제를 해결합니다.
Moonshot이 Hugging Face에 Kimi K3 모델의 가중치를 출시했습니다. 이 모델은 2.8조 개의 파라미터와 mixture-of-experts 아키텍처를 갖추고 있으며, 토큰당 16개의 활성 전문가를 사용합니다. 팀은 A100, H200, B300 GPU에서 모델을 배포할 계획이며, 벤치마크 결과는 이번 주에 예상됩니다.
llama.cpp 프로젝트는 NVFP4 W4A4 활성화 양자화를 개선하기 위해 CUDA 백엔드에 상당한 업데이트를 포함한 버전 b10099를 출시했습니다.
IBM은 80년에 가까운 과학적 공헌을 해온 역사적인 연구 기관인 HRL 랩토리를 인수하기 위한 확정된 계약을 체결했습니다. 이번 인수는 실리콘 스핀 큐비트 엔지니어링 분야에서 HRL의 첨단 전문성을 통합함으로써 IBM의 양자 컴퓨팅 비전을 가속화하는 것을 목표로 합니다.
AMD와 Anthropic은 AI 서버에 수십억 달러 규모의 주요 계약을 체결했으며, Anthropic은 내년 상반기부터 AMD의 Instinct MI450 칩을 최대 2기가와트분 구매합니다. 동시에 특정 배포 마일스톤이 달성됨에 따라 AMD는 Anthropic에 최대 50억 달러를 투자하며, 양사는 하드웨어에 적합한 데이터 센터 위치를 함께 식별하기 위해 협력합니다.
SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리 및 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.
SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리와 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.
IBM이 미국 에너지부(DoE)로부터 제네시스 미션 신청 요청(RFA) 프로젝트의 리더로 선정되어, 이 이니셔티브를 지원하기 위해 최대 5000만 달러 상당의 양자 컴퓨팅 접근 권한을 제공하기로 했습니다.
OpenAI는 조지아주 에핑엄 카운티에서 장기적으로 진행될 프로젝트 캐멜리아 데이터센터 계획과 전력, 상수물, 지역 사회 혜택과 관련된 초기 지역사회 약속 내용을 발표했습니다. 이 회사는 2028년부터 2032년까지 3.2GW의 전력을 공급받기 위해 조지아 파워 컴퍼니와 계약을 체결했습니다.
이 TLDR AI 뉴스레터는 새로운 하드웨어, 소프트웨어 에이전트 및 라우팅 최적화를 포함하여 AI 산업의 여러 발전을 다룹니다.
Together AI와 Y Combinator는 Y Combinator의 포트폴리오에 있는 AI 네이티브 스타트업만을 위해 전용 GPU 클러스터를 제공하기 위한 파트너십을 발표했습니다. 이 계획은 장기적인 계약 없이 유연하고 비용 효율적인 인프라를 제공하여 학습과 추론을 위한 컴퓨팅 접근의 중요한 병목 현상을 해결하는 것을 목표로 합니다.
중국 인공지능 기업 Moonshot AI는 중국에서 GPU 용량이 고갈된 첫 번째 기업이 되었습니다. 이에 따라 회사는 신규 구독 중단과 사용자의 무료 액세스 삭제를 결정했습니다.
Together AI는 GPU 추론을 위해 서로 다른 신뢰성 티어에 도달하는 데 필요한 구체적인 아키텍처 요구 사항을 상세히 설명하며, 표준 SLA 수치가 실제로 커버되는 장애 도메인을 종종 숨긴다고 주장합니다.
NVIDIA는 BlueField 프로세서와의 극단적인 공동 설계가 Agentic AI 워크로드가 제기하는 인프라 과제를 해결할 수 있는 방법을 설명합니다. 동사는 에이전트 시스템이 모델 호출, 도구 상호작용 및 데이터 조회의 복잡한 체인을 트리거함에 따라 전통적인 인프라 패턴이 성능을 유지하기에 불충분하다고 주장합니다.
NVIDIA는 CUDA 13.3에서 carryless multiplication을 위한 새로운 PTX 명령어를 도입하여, x86 CPU에서는 지난 15년 이상 존재해 왔지만 GPU가 이 연산에 대한 네이티브 지원을 결여하고 있던 오랜 격차를 해소했습니다.