마이크로소프트 리서치, 물리적 AI 추론 오프로딩이 로봇 성능과 배터리 수명을 향상시킨다
마이크로소프트 리서치는 물리적 AI 추론이 온보드 로봇 GPU에서만 실행되어야 한다는 가정에 도전하며, 엣지 또는 클라우드 인프라로의 오프로딩이 모바일 조작 워크로드를 크게 향상시킴을 입증했습니다. 그들의 로봇공학 워크로드에 대한 체계적인 연구는 온보드 컴퓨팅 의존성이 성능, 배터리 수명 및 확장성을 제한한다는 것을 보여줍니다.
마이크로소프트 리서치는 물리적 AI 추론이 온보드 로봇 GPU에서만 실행되어야 한다는 가정에 도전하며, 엣지 또는 클라우드 인프라로의 오프로딩이 모바일 조작 워크로드를 크게 향상시킴을 입증했습니다. 그들의 로봇공학 워크로드에 대한 체계적인 연구는 온보드 컴퓨팅 의존성이 성능, 배터리 수명 및 확장성을 제한한다는 것을 보여줍니다.
Parallel은 AI 에이저 인프라에 OpenAI의 GPT-6 Astra를 통합하여 이전 모델 대비 연구 시간과 코드 비용을 각각 50% 절감했습니다. 회사는 새로운 모델이 고품질 출력을 유지하면서 복잡한 지식 작업을 훨씬 빠르게 완료할 수 있게 한다고 보고합니다.
연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.
연구자들은 state-of-the-art ORAM-ANN 시스템의 설계를 역전시켜 대역폭과 접근 횟수를 균형 있게 맞추는 disk-oblivious 근접 이웃(ANN) 검색을 위한 비용 효율적인 접근 방식인 Onyx를 제안합니다.
NVIDIA 연구원들은 격자 기반 프로토콜에 내재된 높은 서버 측 계산 및 메모리 트래픽을 해결하여 GPU에서 프라이빗 정보 검색(PIR)을 가속화하는 시스템인 GPIR을 소개했습니다. 이 시스템은 온칩 데이터 재사용을 최대화하기 위해 연산 수준과 단계 수준 커널 간에 동적으로 전환하는 단계 인식 하이브리드 실행 모델을 사용합니다.
새로운 연구는 프라이버시 보존 기계 학습 추론을 위한 안전한 다자간 계산(MPC) 및 완전 동형 암호화(FHE)의 통합 시스템 수준 특성을 제시합니다. 이 작업은 여러 CNN 및 Transformer 모델에서 두 가지 MPC 변형—산술/이진 공유 변환 및 함수 비밀 공유—과 FHE를 평가합니다.
OpenAI는 거의 40개 지리적 지역에 걸쳐 있는 10억 명 이상의 주간 ChatGPT 사용자를 위해 내부 온라인 스토리지 플랫폼인 Habitat를 초당 7천만 건 이상의 요청을 처리할 수 있도록 확장했습니다. 이 시스템은 이제 단순한 Python 클라이언트 측 라이브러리에서 복잡한 분산 서비스로 진화하여 500페타바이트 이상의 데이터를 제공합니다.
DeepSeek는 극한의 추론 효율성과 낮은 비용을 위해 설계된 새로운 오픈 가중치 플래그십 모델인 V4.1-Flash를 출시했습니다. 이 모델은 활성화된 컴퓨팅과 KV/캐시 비용을 크게 줄이기 위해 인과적 인코더-디코더 아키텍처를 활용합니다.
DeepSeek는 새로운 오픈 웨이트 플래그십 모델인 DeepSeek v4.1-Flash를 출시했으며, 이는 추론 효율성을 극대화하고 비용을 줄이기 위해 설계된 새로운 인과적 인코더-디코더 아키텍처를 특징으로 합니다.
DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.
vLLM 프로젝트는 밀집 접두사 캐시에 대한 핵심 버그 수정을 포함하는 버전 0.29.0을 출시했습니다.
v0.29.0rc5 릴리스는 Mamba 모델에 대해 `prefix_cache_retention_interval` 매개변수의 기본 값을 `dense`로 업데이트합니다.
ThermaCompute AI는 로그 파일을 분석하여 엔지니어가 GPU 충돌을 조사하는 데 도움이 되도록 설계된 무료 로컬 도구인 CrashLens를 출시했습니다. 이 도구는 로그 내의 알려진 실패 패턴을 식별하고 조사를 위한 구체적인 다음 단계를 제안합니다.
llama.cpp 프로젝트는 양자화된 가중치 뷰에 대한 GET_ROWS 연산을 올바르게 처리하기 위한 OpenVINO 백엔드 수정 사항을 포함한 빌드 b11284를 출시했습니다.
llama.cpp 프로젝트는 고정 호스트 버퍼를 활용하여 텐서 allreduce 동기화를 줄이는 변경 사항이 포함된 버전 b11280을 출시했습니다.
llama.cpp 프로젝트는 `CUDA_ARCH` 매크로를 MUSA 디바이스 패스에 대해 정의하는 수정 사항을 포함하는 빌드 b11282를 출시했습니다. 이전에는 MUSA 벤더 헤더가 이 변수를 정의하지 않아 공유 ggml-cuda 소스의 아키텍처 테스트가 0으로 평가되고 빈 커널 본문이 생성되었습니다.
llama.cpp 프로젝트는 하이브리드 인덱스 메모리로의 마이그레이션 및 초기 Multi-Token Prediction (MTP) 기능을 포함하여 GLM-5.3-Flash (GLM5-Next) 모델 아키텍처에 대한 초기 지원을 추가했습니다.
llama.cpp 프로젝트가 빌드 b11273을 출시했으며, 이는 ModernBERT 아키텍처를 대상으로 리랭킹 모델에서 `classifier_pooling` 메서드에 대한 지원을 도입합니다.
llama.cpp 프로젝트는 Hexagon 백엔드에 대한 최적화를 포함한 빌드 b11272을 출시했습니다. 주요 변경 사항은 Qualcomm Snapdragon 하드웨어에서 성능을 향상시키기 위해 연결 연산을 최적화하는 것입니다.
연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.