오픈AI는 NVIDIA GB200/GB300 시스템 대비 뛰어난 효율성과 지연 시간을 주장하며 맞춤형 추론 칩인 할라페뇨의 벤치마크 세부 사항을 게시했습니다. 동시에 퍼플렉시티는 클라우드 의존성 없이 완전한 로컬 에이전트 오케스트레이션을 가능하게 하는 NVIDIA DGX Spark 하드웨어에서 휴대용 컴퓨터를 출시했습니다.

  • 테스트에서 오픈AI의 할라페뇨는 와트당 작업량이 1.5–1.9배 더 많고 엔드투엔드 지연 시간이 1.7–3.6배 낮았습니다.
  • 이 칩은 700W로 평가되었지만 테스트 중에는 550W 미만으로 유지되었으며, 연말까지 배포가 계획되어 있습니다.
  • 퍼플렉시티의 휴대용 컴퓨터는 PPLX 27B 또는 Qwen 3.8 27B를 사용하여 오케스트레이터 LLM, 서브에이전트 LLM 및 에이전트 하네스를 로컬에서 실행합니다.
  • 마이크로소프트가 주도한 AutoSaddler은 에이전트 하네스를 코드처럼 처리하여 GAIA2에서 +9.0, Terminal-Bench 2.0에서 +10.0의 성능 향상을 보고했습니다.
  • SWE 리팩토링 벤치마크는 520회 실행 전수 저장소 마이그레이션 작업에 대해 5.4%의 생존율만 발견했습니다.

이러한 발전은 클라우드 인프라에 대한 의존도를 줄이는 전문화된 추론 하드웨어와 로컬 우선 에이전트 아키텍처로의 전환을 강조합니다.