NanoMaestro Realtime는 13M 파라미터를 가진 50MB AI 음악 모델로, 2층 LSTM을 사용하여 피아노 음악을 실시간으로 생성합니다. ONNX와 Transformers.js 및 WASM을 통해 브라우저 내에서 로컬로 실행되며 GPU나 서버 백엔드가 필요하지 않으며 오래된 Raspberry Pi 모델에서도 작동합니다.
AI 음악 모델이 브라우저에서 대부분의 CPU에서 실시간으로 실행
Gradio가 Workflow1111을 출시하여 AUTOMATIC1111 기능을 Gradio 그래프로 재구축
Gradio는 gr.Workflow 프레임워크를 사용하여 AUTOMATIC1111의 stable-diffusion-webui 기능 세트 대부분을 재구축한 프로젝트인 Workflow1111을 출시했습니다. 이 애플리케이션은 텍스트-이미지, 이미지-비디오, 다양한 전처리 작업을 아우르는 73개의 노드로 구성된 11개 미디어 파이프라인이 포함된 단일 캔버스로 구성됩니다.
OpenEnv가 TRL을 사용해 Surya Narreddi의 수채화 모델 재현
한 엔지니어가 JavaScript와 강화학습을 활용해 수채화를 그리는 코딩 모델을 훈련하는 Surya Narreddi의 바이럴 프로젝트를 복제해 오픈소스로 공개했다. 이 구현은 TRL 라이브러리와 OpenEnv를 활용하여 Hugging Face 위에서 훈련, 평가, 추론을 위한 엔드투엔드 파이프라인을 구축한다.
Diffusers에 Nunchaku Lite 4비트 추론 네이티브 지원 추가
Hugging Face Diffusers는 이제 `from_pretrained()`를 통해 Nunchaku Lite 체크포인트를 네이티브로 로드할 수 있게 되어 별도의 추론 엔진이나 로컬 CUDA 컴파일이 필요하지 않게 되었습니다. 이 통합은 SVDQuant 방법을 사용하여 4비트 가중치와 활성화(W4A4)로 트랜스포머 레이어를 실행하며, 메모리 사용량을 크게 줄이는 동시에 추론 속도를 향상시킵니다.
NVIDIA NeMo Automodel은 Hugging Face Diffusers와 함께 분산 디퓨전 모델 파인튜닝을 가능하게 합니다
NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.
Simon Willison이 GPT-5.6 및 gpt-image-2를 사용하여 Codex Desktop 펫을 만듦
Simon Willison은 OpenAI의 GPT-5.6 Sol 모델과 gpt-image-2 API를 활용하여 Codex Desktop 애플리케이션용 사용자 정의 애니메이션 "펫"을 만드는 방법을 시연합니다.