Image generation
lab NVIDIA Research · 12일 전 · 조회수 8회

2D 가우시안 기반 이미지 압축을 위한 클러스터화된 코드북 양자화

연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.

lab Hugging Face Blog · 17일 전 · 조회수 2회

Diffusers에 Nunchaku Lite 4비트 추론 네이티브 지원 추가

Hugging Face Diffusers는 이제 `from_pretrained()`를 통해 Nunchaku Lite 체크포인트를 네이티브로 로드할 수 있게 되어 별도의 추론 엔진이나 로컬 CUDA 컴파일이 필요하지 않게 되었습니다. 이 통합은 SVDQuant 방법을 사용하여 4비트 가중치와 활성화(W4A4)로 트랜스포머 레이어를 실행하며, 메모리 사용량을 크게 줄이는 동시에 추론 속도를 향상시킵니다.

media r/LocalLLaMA · 17일 전 · 조회수 5회

Microsoft, 이미지 생성 및 편집을 위한 4B 네이티브 해상도 모델 Mage-Flow 출시

Microsoft는 효율적인 텍스트-이미지 생성과 지시 기반 이미지 편집을 위해 설계된 경량 4B 규모 생성 스택인 Mage-Flow를 출시했습니다. 이 시스템은 경량 토크나이저인 Mage-VAE와 네이티브 해상도 멀티모달 디퓨전 트랜스포머(NR-MMDiT)의 공동 설계를 통해 최첨단 경쟁 수준의 품질을 달성합니다.

lab Hugging Face Blog · 23일 전 · 조회수 5회

NVIDIA NeMo Automodel은 Hugging Face Diffusers와 함께 분산 디퓨전 모델 파인튜닝을 가능하게 합니다

NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.

arxiv arXiv cs.AI · 26일 전 · 조회수 1회

CtrlVTON은 시각적 인스턴스 프롬프트 분할을 통해 제어 가능한 가상 피팅을 가능하게 합니다

저자들은 CtrlVTON이라는 프레임워크를 소개합니다. 이는 가상 피팅에서의 사용자 제어 부족 문제를 해결하기 위해 작업을 픽셀 수준 분할 마스크를 사용한 이미지 편집으로 재정의합니다. 이 접근 방식을 통해 사용자는 의류의 크기, 스타일 및 신체 상의 공간적 배치를 지정할 수 있습니다.

media Hugging Face Forums · 28일 전

HoLo-FuSe는 0-파라미터 HSL 기판을 사용한 클래스 조건부 이미지 생성

HoLo-FuSe는 동결된 0-파라미터 HoLo Semantic Layer (HSL) 바이트 기판이 이미지 생성을 위한 확산 모델을 효과적으로 조건화할 수 있음을 입증했습니다. 이 프로젝트는 이 결정론적인 27-D 특징 프레임이 전통적인 학습 임베딩을 대체하여 클래스 조건부 DDPM의 조건화 메커니즘으로 기능할 수 있는지 테스트합니다.

media r/LocalLLaMA · 28일 전 · 조회수 3회

ZimengXiong, Apple Silicon 및 iPhone용 MLX로 Hunyuan3D 포트

개발자 ZimengXiong은 Hunyuan3D-Paint 및 Hunyuan3D-Shape 모델에 대한 Swift-MLX 및 Python MLX 포트를 완료하여 Apple Silicon 장치에서 로컬 이미지-3D 생성을 가능하게 했습니다. 이 작업은 macOS 및 iOS용 오픈소스 Modelr 데스크톱 앱으로 배포되며, Swift 애플리케이션에 기술을 통합하기 위한 소스 코드도 포함되어 있습니다.