전체 기사
media Hugging Face Forums · 14시간 전

Prism Transformer: 계층적 어텐션 처리를 위한 점진적 헤드 스케줄

Prism Transformer는 레이어 간 어텐션 헤드 수를 가변적으로 조절하는 점진적 헤드 스케줄을 도입합니다. 이는 초기 레이어에서 적고 넓은 헤드로 시작하여 깊이에 따라 단조 증가시킵니다. 이 접근 방식은 아키텍처 오버헤드를 추가하지 않고 초기와 후기 레이어의 구조적 필요를 해결함으로써 표준 균일 할당에 도전합니다.

media Hugging Face Forums · 15시간 전

프랙탈 드리밍 + 양자 영감 계획: DeepSeek Coder을 사용한 자기 조직화 지식 발견 도구

저자는 프랙탈 패턴 생성과 양자 영감 중첩을 통합하여 DeepSeek Coder의 지식 공간 탐색을 강화하는 자기 조직화 지식 발견 도구를 제시합니다. 이 시스템은 성공적인 창의적 경로를 메모리가 아닌 캐시된 쿼리로 저장하여 검색 궤적을 최적화하고, 하드웨어 제약에 따라 리소스 사용을 적응시킵니다.

lab Hugging Face Blog · 16시간 전

ScarfBench: 엔터프라이즈 Java 프레임워크 마이그레이션을 위한 AI 에이전트 벤치마킹

본 기사는 엔터프라이즈 Java 애플리케이션을 다른 프레임워크 간에 마이그레이션하는 동안 AI 에이전트의 성능을 평가하도록 설계된 벤치마크인 ScarfBench를 소개합니다. 이 연구는 프레임워크 마이그레이션의 복잡성을 강조하고 이 영역에서 에이전트 능력을 평가하기 위한 표준화된 평가 방법을 제안합니다.

github llama.cpp · 1일 전

llama.cpp b9857 릴리스: Flash Attention 재구현 및 새로운 바이너리

llama.cpp b9857 릴리스는 Hexagon Flash Attention 구현의 포괄적인 재구현을 도입하여 최적화와 정확도 개선을 중점적으로 다룹니다. 이 업데이트에는 hex-mm 및 hex-fa 모듈에 대한 주요 변경 사항이 포함되어 있으며, 여기에는 양자화 작업을 주 matmul 스레드에 병합하고 ADD 연산과 융합하며 마스크 처리를 최적화하는 작업이 포함됩니다.