NVIDIA는 사용자가 구형 하드웨어를 개인 AI 클러스터에 연결할 수 있도록 돕기 위해 설계된 도구인 PAIR를 소개했습니다. 이 이니셔티브는 기존 장치를 활용하여 로컬에서 AI 워크로드를 실행하는 것을 목표로 합니다.
이 프로젝트는 개인이 축적된 하드웨어 리소스를 인공지능 작업에 활용할 수 있게 합니다.
NVIDIA는 사용자가 구형 하드웨어를 개인 AI 클러스터에 연결할 수 있도록 돕기 위해 설계된 도구인 PAIR를 소개했습니다. 이 이니셔티브는 기존 장치를 활용하여 로컬에서 AI 워크로드를 실행하는 것을 목표로 합니다.
이 프로젝트는 개인이 축적된 하드웨어 리소스를 인공지능 작업에 활용할 수 있게 합니다.
FlashAttention-4는 비원인적(noncausal) 추론과 인과적(causal) 학습을 위한 새로운 경로를 도입하여 Blackwell의 4비트 부동소수점(FP4) 텐서 코어의 성능 한계를 해결합니다. Direct-P라고 불리는 이 방법은 행렬 곱이 축소됨에 따라 지배적이 되는 소프트맥스 변환 오버헤드를 우회하기 위해 점수를 직접 FP4 확률로 매핑합니다.
NVIDIA는 차세대 Vera Rubin GPU의 출시를 2027년 중반으로 예약했습니다. 회사는 현재 분기 동안 200억 달러 상당의 Vera Rubin 하드웨어를 판매하여 데이터 센터 수익의 20%를 차지할 것으로 예상합니다.
Perplexity는 에이전트 하니스, 오케스트레이터, 플래너, 도구 라우터 및 사후 학습 모델을 NVIDIA DGX Spark 하드웨어 위에서 직접 실행하는 자체 에이전트 플랫폼의 로컬 우선 빌드인 Portable Computer를 출시했습니다. 이 패키징된 시스템은 모든 작업을 디바이스 시작점에서 처리하며, 로컬 모델이 처리한 작업에 대해 토큰당 요금을 부과하지 않고, 사용자 승인 시에만 15개 이상의 클라우드 모델로 특정 단계를 격상시킵니다.
NVIDIA는 Python에서 GPU 컴퓨팅을 위한 통합 기반을 제공하는 CUDA Python 1.0을 출시했습니다. 이번 릴리스는 플랫폼에 안정적인 API를 도입합니다.
OpenAI는 자체 첫 번째 맞춤형 추론 칩인 할라페뇨의 초기 성능 결과를 발표했으며, 기존 상용 시스템 대비 속도와 전력 효율성에서 상당한 개선을 보였습니다. 회사는 새로운 아키텍처가 동시에 더 높은 처리량과 낮은 지연 시간을 가능하게 하여 현재 하드웨어에서 흔히 발생하는 트레이드오프를 해결한다고 밝혔습니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침