Inference efficiency
arxiv arXiv cs.AI · 4시간 전 · 조회수 9회

CliffCompaction은 성능을 유지하면서 코딩 에이전트 비용을 50% 절감합니다

연구원들은 CliffCompaction을 소개했습니다. 이는 제한된 컨텍스트 하에서 장기적 코딩 에이전트의 비용을 최대 50%까지 줄이기 위해 설계된 자동 압축 기술입니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재문장화 대신 잘라내기를 통해 압축된 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성합니다.

arxiv arXiv cs.LG · 5시간 전 · 조회수 9회

CliffCompaction은 성능을 유지하면서 장기적 코딩 에이전트 비용을 최대 50%까지 절감합니다

연구원들은 수백만 개의 토큰을 처리하는 에이전트를 위해 설계된 자동 압축 기법인 CliffCompaction을 소개했으며, 이는 제한된 컨텍스트 하에서 비용을 최대 50%까지 절감합니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재표현이 아닌 잘라내기를 통해 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성했습니다.

github llama.cpp · 17시간 전 · 조회수 9회

llama.cpp가 HunyuanOCR에 대한 DFlash 지원을 추가하고 드래프트 변환을 수정함

llama.cpp 프로젝트는 타겟 그래프에서 레이어 입력 텐서를 노출하여 HunyuanOCR 모델과 함께 DFlash 추측 디코딩에 대한 지원을 추가했습니다. 이 변경 사항으로 드래프트 모델이 잔류 스트림을 읽을 수 있게 되어, 비추측 실행과 비교할 때 약 0.5의 드래프트 수용률과 바이트 단위로 동일한 OCR 출력을 유지하며 이미지 요청을 성공적으로 실행할 수 있습니다.

media Hugging Face Forums · 1일 전 · 조회수 11회

로컬 그리스어 사용을 위해 Llama-Krikri-8B-Instruct를 제거하는 워크플로우를 찾는 사용자

한 사용자가 ilsp/Llama-Krikri-8B-Instruct 체크포인트를 사용하여 로컬 배포용 무검열 그리스어 네이티브 대규모 언어 모델을 구축할 계획입니다. 제안된 계획은 Heretic(heretic-llm)을 사용하여 모델을 제거하고, GGUF Q4_K_M 형식으로 변환한 후 AMD Ryzen AI MAX+ 395 프로세서와 Vulkan을 탑재한 GMKtec EVO-X3에서 추론을 실행하는 것입니다.

media Together AI Blog · 1일 전 · 조회수 11회

Together AI, 중단 시간 없이 프로덕션에서 모델을 업그레이드하기 위한 Canary 롤아웃 도입

Together AI는 현재 모델의 라이브 트래픽을 게이트된 단계로 새 체크포인트로 마이그레이션하는 기능인 Canary 롤아웃을 도입했습니다. 이 시스템은 트래픽 이동 전에 헬스 체크와 선택적 메트릭 게이트를 실행하여 모델 교체에 대한 안전 장치를 자동화하며, 성능이 저하될 경우 자동으로 일시 중지하고 되돌릴 수 있습니다.

arxiv arXiv cs.AI · 1일 전 · 조회수 9회

AgentRouter는 단계별 모델 라우팅을 통해 에이전트 워크플로우 비용을 72% 절감

연구자들은 에이전트 워크플로우의 다단계 과정을 최적화하기 위해 AgentRouter를 제안했습니다. 이는 매 작업마다 최상위 모델을 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하는 경량 분류기입니다. 이 시스템은 단일 에이전트 세션 내에서 하위 작업 복잡성이 다양함을 무시하는 기존 솔루션의 비효율성을 해결합니다.

arxiv arXiv cs.CL · 1일 전 · 조회수 11회

AgentRouter가 단계별 모델 라우팅을 통해 에이전트 워크플로우 비용을 72% 절감

연구자들은 AgentRouter를 제안했는데, 이는 단일 최첨단 모델을 모든 작업에 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하여 다단계 에이전트 워크플로우를 최적화하는 경량 분류기입니다. 이 시스템은 더 작은 모델로도 충분히 처리할 수 있는 하위 작업에 추론 예산의 60-80%를 낭비하는 기업 시스템의 비효율성을 해결합니다.