알리바바, 5조~10조 파라미터 AI 모델 계획 및 새로운 칩 발표
알리바바는 5조에서 10조 개의 매개변수를 포함하는 인공지능 모델을 개발할 계획을 발표했습니다. 이 로드맵과 함께 회사는 인프라 요구 사항을 지원하도록 설계된 새로운 맞춤형 칩도 공개했습니다.
알리바바는 5조에서 10조 개의 매개변수를 포함하는 인공지능 모델을 개발할 계획을 발표했습니다. 이 로드맵과 함께 회사는 인프라 요구 사항을 지원하도록 설계된 새로운 맞춤형 칩도 공개했습니다.
화웨이는 중국 내부의 수요가 가용 공급량을 초과함에 따라 인공지능 칩의 국제적 확장을 일시 중단했습니다. 이러한 전략적 전환으로 인해 AMD와 엔비디아 등의 경쟁사는 화웨이의 글로벌 시장 진입으로 인한 즉각적인 압박을 더 이상 받지 않게 되었습니다.
Hugging Face의 제안은 AI의 두 가지 상호 연결된 문제를 논의합니다: 개별 대형 모델을 훈련하는 의존성과 생태계의 범용 GPU에 대한 의존성.
llama.cpp 프로젝트가 Apple Silicon 하드웨어를 위한 Metal 백엔드에 상당한 업데이트를 도입한 빌드 b11059를 출시했습니다. 주요 변경 사항은 Fast Walsh-Hadamard Transform (FWHT) 커널에 F16 입력 지원이 추가되어 변환된 복사본 없이 F16 소스를 직접 읽을 수 있게 되었다는 것입니다.
llama.cpp 프로젝트는 Vulkan mul_mat_id 연산의 hoisted row-id 한계를 256명에서 1024명으로 늘렸습니다. 이 변경은 이전에 공유 배열 크기 제약으로 인해 더 느린 코드 경로를 실행했던 Qwen3.8-Flash-Next와 같은 대규모 전문가 수를 가진 모델의 성능 병목 현상을 해결합니다.
llama.cpp 프로젝트는 RDNA3.5 아키텍처를 지원하기 위해 Mixture of Experts (MoE) ncols_opt 타일 휴리스틱에 변경 사항을 포함한 버전 b10997을 출시했습니다.
llama.cpp b10994 릴리스에는 활성화 값이 f16 범위를 초과할 때 `mul_mm_id` 연산에서 NaN 출력을 해결하는 Metal 백엔드에 대한 수정 사항이 포함되어 있습니다. 이 결함으로 인해 이전에는 Apple Silicon 장치에서 32개 이상의 토큰에 대한 프리필 단계 동안 Mistral Small 4와 같은 모델이 완전히 NaN 어휘를 생성했습니다.
연구자들은 여러 신뢰할 수 없는 가속기가 공유 가상 주소 공간 내에서 사전 번역된 주소를 안전하게 재사용할 수 있는 IOMMU 설계인 ShareMMU를 제시합니다. 이 접근 방식은 큰 공유 번역 사이드체인드 버퍼(TLB)와 관련된 사이드체인드 위험을 완화하면서도 높은 성능을 유지합니다.
저자는 소비자용 NVIDIA GPU에서 열 인식을 갖춘 QLoRA 파인튜닝을 위한 Windows 우선 런타임인 MOLT를 구축하고, RTX 4060 노트북 GPU에서 100만 개의 Qwen 1.5B 학습 타겟을 사용하여 Unsloth와 벤치마킹했습니다.
한 사용자가 DeepSeek V4.1 모델을 NVIDIA A100 GPU에서 공식 API를 초과하는 성능으로 실행할 수 있는 사용자 지정 구현을 개발했습니다.
Hugging Face 포럼의 제안서는 NVIDIA, AMD, Intel과 같은 특정 하드웨어 벤더로부터 애플리케이션 코드를 분리하기 위해 설계된 공통 GPU 실행 및 메모리 관리 레이어를 개요로 제시합니다. 목표는 백엔드별 플래그, 디바이스 매핑 또는 오프로딩 전략을 수동으로 구성하는 대신 사용자가 메모리 예산을 지정할 수 있도록 하는 것입니다.
연구자들은 state-of-the-art ORAM-ANN 시스템의 설계를 역전시켜 대역폭과 접근 횟수를 균형 있게 맞추는 disk-oblivious 근접 이웃(ANN) 검색을 위한 비용 효율적인 접근 방식인 Onyx를 제안합니다.
NVIDIA 연구원들은 격자 기반 프로토콜에 내재된 높은 서버 측 계산 및 메모리 트래픽을 해결하여 GPU에서 프라이빗 정보 검색(PIR)을 가속화하는 시스템인 GPIR을 소개했습니다. 이 시스템은 온칩 데이터 재사용을 최대화하기 위해 연산 수준과 단계 수준 커널 간에 동적으로 전환하는 단계 인식 하이브리드 실행 모델을 사용합니다.
새로운 연구는 프라이버시 보존 기계 학습 추론을 위한 안전한 다자간 계산(MPC) 및 완전 동형 암호화(FHE)의 통합 시스템 수준 특성을 제시합니다. 이 작업은 여러 CNN 및 Transformer 모델에서 두 가지 MPC 변형—산술/이진 공유 변환 및 함수 비밀 공유—과 FHE를 평가합니다.
Together AI의 커널 팀은 NVIDIA Vera Rubin NVL72 플랫폼의 새로운 기능을 활용하기 위해 ThunderKittens 라이브러리를 최적화했으며, 이는 주로 NVFP4 및 FP8 행렬 곱셈의 성능 향상을 목표로 합니다.
Together AI는 Kubernetes에서 Together GPU Clusters를 위한 프리엠프터블 컴퓨팅의 공개 미리보기를 발표하며, 중단 허용 워크로드에 대해 더 낮은 비용 옵션을 제공합니다. 프리엠프터블 노드는 미사용 NVIDIA accelerated 용량을 활용하며 온디맨드 요금의 고정 50%로 청구됩니다.
llama.cpp 프로젝트는 PowerVR GPU에서 치명적인 안정성 문제를 해결한 버전 b10891을 출시했습니다. 이 업데이트는 Vulkan 백엔드를 수정하여 dequantized matrix-vector multiplication(dmmv) 연산에 공유 메모리 감소를 폴백하도록 합니다.
MIT 양자 시스템 공학 그룹의 Beatriz Yankelevich는 Codex와 통합된 GPT‑5.6 Sol을 사용하여 초전도 큐비트의 일상적인 측정을 자율적으로 실행하고 정교화했습니다. 이 통합으로 AI 에이전트는 실험실 소프트웨어를 작동하고 결과를 분석하며 지속적인 인간 감독 없이 다음 단계를 결정할 수 있습니다.
Anthropic은 지난 11개월 동안 Google과 AWS를 주로 하여 14.8GW에 해당하는 $5170억의 컴퓨팅 용량 리스를 확보했습니다. 이 확장에는 Akamai와 Fluidstack 같은 클라우드 제공업체와의 대규모 거래 및 Nscale과의 $450억 계약이 포함됩니다.
llama.cpp 프로젝트가 버전 b10839를 출시하여, 텐서 행 검색 작업 중 정렬되지 않은 오프셋으로 인해 Vulkan 백엔드에서 발생하는 심각한 충돌을 해결했습니다. 이전에는 `ggml_view`와 비영(view) 오프셋 사용 시, `minStorageBufferOffsetAlignment`에 대한 정렬 위반으로 셰이더가 어설션에 도달하면서 Qwen3-TTS 및 Qwen3-VL 같은 모델이 실패했습니다. 이번 업데이트는 양자화 경로와 비양자화 경로 모두에서 정렬된 오프셋에 대한 네이티브 지원을 구현하여 CPU 폴백의 필요성을 제거했습니다.