주제 · Inference efficiency
lab Microsoft Research Blog · 7일 전 · 조회수 28회

마이크로소프트 리서치, 물리적 AI 추론 오프로딩이 로봇 성능과 배터리 수명을 향상시킨다

마이크로소프트 리서치는 물리적 AI 추론이 온보드 로봇 GPU에서만 실행되어야 한다는 가정에 도전하며, 엣지 또는 클라우드 인프라로의 오프로딩이 모바일 조작 워크로드를 크게 향상시킴을 입증했습니다. 그들의 로봇공학 워크로드에 대한 체계적인 연구는 온보드 컴퓨팅 의존성이 성능, 배터리 수명 및 확장성을 제한한다는 것을 보여줍니다.

lab NVIDIA Research · 16일 전 · 조회수 20회

FastGen-PDD, 빠른 비디오 및 이미지 생성을 위한 병렬 디코딩 지식 증류 도입

연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.

lab NVIDIA Research · 19일 전 · 조회수 28회

NVIDIA, GPU 가속 프라이빗 정보 검색을 위한 GPIR 출시

NVIDIA 연구원들은 격자 기반 프로토콜에 내재된 높은 서버 측 계산 및 메모리 트래픽을 해결하여 GPU에서 프라이빗 정보 검색(PIR)을 가속화하는 시스템인 GPIR을 소개했습니다. 이 시스템은 온칩 데이터 재사용을 최대화하기 위해 연산 수준과 단계 수준 커널 간에 동적으로 전환하는 단계 인식 하이브리드 실행 모델을 사용합니다.

lab OpenAI News · 19일 전 · 조회수 37회

OpenAI, Habitat 스토리지 서비스를 초당 7천만 건의 요청으로 확장

OpenAI는 거의 40개 지리적 지역에 걸쳐 있는 10억 명 이상의 주간 ChatGPT 사용자를 위해 내부 온라인 스토리지 플랫폼인 Habitat를 초당 7천만 건 이상의 요청을 처리할 수 있도록 확장했습니다. 이 시스템은 이제 단순한 Python 클라이언트 측 라이브러리에서 복잡한 분산 서비스로 진화하여 500페타바이트 이상의 데이터를 제공합니다.

media MarkTechPost · 20일 전 · 조회수 55회

DeepSeek, 1M 컨텍스트와 FP4 KV 캐시를 갖춘 DeepSeek-V4.1-Flash 출시

DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.

arxiv arXiv cs.CL · 17시간 전 · 조회수 1회

컨텍스트 언어 모델은 컨텍스트를 편집 가능한 파일로 네이티브하게 관리합니다

연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.