Hardware & chips
github llama.cpp · 5일 전 · 조회수 2회

llama.cpp b10255이 oneDNN SDPA를 비FP16 KV 캐시에 확장

llama.cpp b10255 릴리스는 Q4_0–Q8_0 양자화된 포맷과 FP32를 포함하여 비FP16 키-값(KV) 캐시를 지원하도록 oneDNN SDPA 경로를 확장합니다. 이 업데이트는 K/V 텐서를 처리하기 전에 온디바이스에서 디쿼티징하거나 밀집 FP16으로 변환함으로써 융합된 systolic 커널이 네이티브 FP16 경로와 동일하게 실행되도록 합니다.

media Hugging Face Forums · 12일 전 · 조회수 1회

페이선스 스트롱, 신경망을 반도체 소자로 구축할 것을 제안

페이선스 스트롱은 현재 신경망이 소프트웨어에서 회로를 에뮬레이션하는 대신 물리적 하드웨어로 구현함으로써 과도한 컴퓨팅 파워를 소비한다고 주장합니다. 논문에서는 이 에뮬레이션을 가중치와 바이어스가 비휘발성 메모리에 저장되는 반도체 소자로 대체할 것을 제안합니다.

media TLDR AI · 17일 전 · 조회수 1회

AMD + Anthropic 계약: AMD가 MI450 칩 공급 및 50억 달러 투자

AMD와 Anthropic은 AI 서버에 수십억 달러 규모의 주요 계약을 체결했으며, Anthropic은 내년 상반기부터 AMD의 Instinct MI450 칩을 최대 2기가와트분 구매합니다. 동시에 특정 배포 마일스톤이 달성됨에 따라 AMD는 Anthropic에 최대 50억 달러를 투자하며, 양사는 하드웨어에 적합한 데이터 센터 위치를 함께 식별하기 위해 협력합니다.

arxiv arXiv cs.AI · 17일 전 · 조회수 4회

SLAI의 T-Rex가 Ascend SuperPOD에서 DeepSeek-V4의 전체 파라미터 사후 학습을 가능하게 함

SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리 및 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.

arxiv arXiv cs.CL · 17일 전 · 조회수 1회

SLAI의 T-Rex가 Ascend SuperPOD에서 DeepSeek-V4의 전체 파라미터 사후 학습을 가능하게 함

SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리와 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.

lab OpenAI News · 18일 전 · 조회수 2회

OpenAI, 에핑엄 카운티의 프로젝트 캐멜리아 데이터센터에 대한 약속을 명시

OpenAI는 조지아주 에핑엄 카운티에서 장기적으로 진행될 프로젝트 캐멜리아 데이터센터 계획과 전력, 상수물, 지역 사회 혜택과 관련된 초기 지역사회 약속 내용을 발표했습니다. 이 회사는 2028년부터 2032년까지 3.2GW의 전력을 공급받기 위해 조지아 파워 컴퍼니와 계약을 체결했습니다.

media Together AI Blog · 20일 전 · 조회수 2회

Together AI와 Y Combinator가 YC 스타트업을 위한 전용 GPU 클러스터 출시

Together AI와 Y Combinator는 Y Combinator의 포트폴리오에 있는 AI 네이티브 스타트업만을 위해 전용 GPU 클러스터를 제공하기 위한 파트너십을 발표했습니다. 이 계획은 장기적인 계약 없이 유연하고 비용 효율적인 인프라를 제공하여 학습과 추론을 위한 컴퓨팅 접근의 중요한 병목 현상을 해결하는 것을 목표로 합니다.

lab NVIDIA Technical Blog · 24일 전 · 조회수 2회

NVIDIA, BlueField 공동 설계를 제안하여 Agentic AI 팩토리 확장

NVIDIA는 BlueField 프로세서와의 극단적인 공동 설계가 Agentic AI 워크로드가 제기하는 인프라 과제를 해결할 수 있는 방법을 설명합니다. 동사는 에이전트 시스템이 모델 호출, 도구 상호작용 및 데이터 조회의 복잡한 체인을 트리거함에 따라 전통적인 인프라 패턴이 성능을 유지하기에 불충분하다고 주장합니다.