Hardware & chips
github llama.cpp · 7일 전 · 조회수 20회

llama.cpp b10994이 큰 활성화에 대한 mul_mm_id의 Metal NaN을 수정함

llama.cpp b10994 릴리스에는 활성화 값이 f16 범위를 초과할 때 `mul_mm_id` 연산에서 NaN 출력을 해결하는 Metal 백엔드에 대한 수정 사항이 포함되어 있습니다. 이 결함으로 인해 이전에는 Apple Silicon 장치에서 32개 이상의 토큰에 대한 프리필 단계 동안 Mistral Small 4와 같은 모델이 완전히 NaN 어휘를 생성했습니다.

lab NVIDIA Research · 7일 전 · 조회수 16회

ShareMMU는 낮은 오버헤드로 신뢰할 수 없는 가속기 간 안전한 주소 변환 공유를 가능하게 합니다

연구자들은 여러 신뢰할 수 없는 가속기가 공유 가상 주소 공간 내에서 사전 번역된 주소를 안전하게 재사용할 수 있는 IOMMU 설계인 ShareMMU를 제시합니다. 이 접근 방식은 큰 공유 번역 사이드체인드 버퍼(TLB)와 관련된 사이드체인드 위험을 완화하면서도 높은 성능을 유지합니다.

media Hugging Face Forums · 11일 전 · 조회수 13회

메모리 예산 인식 실행을 위한 벤더 중립적 AI 런타임 제안

Hugging Face 포럼의 제안서는 NVIDIA, AMD, Intel과 같은 특정 하드웨어 벤더로부터 애플리케이션 코드를 분리하기 위해 설계된 공통 GPU 실행 및 메모리 관리 레이어를 개요로 제시합니다. 목표는 백엔드별 플래그, 디바이스 매핑 또는 오프로딩 전략을 수동으로 구성하는 대신 사용자가 메모리 예산을 지정할 수 있도록 하는 것입니다.

lab NVIDIA Research · 11일 전 · 조회수 21회

NVIDIA, GPU 가속 프라이빗 정보 검색을 위한 GPIR 출시

NVIDIA 연구원들은 격자 기반 프로토콜에 내재된 높은 서버 측 계산 및 메모리 트래픽을 해결하여 GPU에서 프라이빗 정보 검색(PIR)을 가속화하는 시스템인 GPIR을 소개했습니다. 이 시스템은 온칩 데이터 재사용을 최대화하기 위해 연산 수준과 단계 수준 커널 간에 동적으로 전환하는 단계 인식 하이브리드 실행 모델을 사용합니다.

lab OpenAI News · 15일 전 · 조회수 39회

MIT의 GPT-5.6 Sol이 Codex를 통해 양자 칩 보정을 자동화

MIT 양자 시스템 공학 그룹의 Beatriz Yankelevich는 Codex와 통합된 GPT‑5.6 Sol을 사용하여 초전도 큐비트의 일상적인 측정을 자율적으로 실행하고 정교화했습니다. 이 통합으로 AI 에이전트는 실험실 소프트웨어를 작동하고 결과를 분석하며 지속적인 인간 감독 없이 다음 단계를 결정할 수 있습니다.

github llama.cpp · 16일 전 · 조회수 44회

llama.cpp b10839, Vulkan GET_ROWS 정렬되지 않은 오프셋 충돌 수정

llama.cpp 프로젝트가 버전 b10839를 출시하여, 텐서 행 검색 작업 중 정렬되지 않은 오프셋으로 인해 Vulkan 백엔드에서 발생하는 심각한 충돌을 해결했습니다. 이전에는 `ggml_view`와 비영(view) 오프셋 사용 시, `minStorageBufferOffsetAlignment`에 대한 정렬 위반으로 셰이더가 어설션에 도달하면서 Qwen3-TTS 및 Qwen3-VL 같은 모델이 실패했습니다. 이번 업데이트는 양자화 경로와 비양자화 경로 모두에서 정렬된 오프셋에 대한 네이티브 지원을 구현하여 CPU 폴백의 필요성을 제거했습니다.