주제 · Image generation
lab Google — The Keyword (AI) · 21일 전 · 조회수 41회

Google DeepMind, 다큐멘터리를 위해 부부의 미기록 기억을 AI로 재현

영화 제작자 Liz Garbus 및 Primordial Soup와의 협력으로 Google DeepMind은 단편 다큐멘터리 "Love, Rendered"를 위해 Burt와 Ethelle Shatz의 촬영되지 않은 만남을 재구성하기 위해 생성형 AI 모델을 사용했습니다. 이 프로젝트는 부부의 마음속에만 존재했던 특정 기억을 재현하여 인지 감퇴에 대응합니다.

arxiv arXiv cs.AI · 2일 전 Multi-SWE-bench · 7.37% · 조회수 1회

AutoRef가 다중 참조 이미지 생성을 위한 에이전트 하니스를 최적화합니다

연구자들은 기본 모델을 동결한 채로 에이전트 기반 다중 참조 이미지 생성을 위한 실행 하니스를 자동으로 최적화하는 방법인 AutoRef를 제안합니다. 코딩 에이전트는 주체 누락과 부자연스러운 구성과 같은 과제를 해결하기 위해 하니스 코드를 반복적으로 다시 작성합니다.

media Hugging Face Forums · 3일 전 · 조회수 4회

Hung Tran, 과적합된 신경망 이미지 코덱의 클리핑 함정 식별

VNU-HCM 정보기술대학원 석사 과정 학생인 Hung Tran은 "The Clipping Trap: A Silent Failure Mode in Overfitted Neural Image Codecs"라는 논문의 코드와 데이터를 공개했습니다. 이 연구는 Cool-chic 및 C3와 같은 과적합된 코덱이 특정 콘텐츠 유형에서 왜곡 기울기가 0인 평탄한 색상의 이미지를 생성할 수 있는 방법을 강조합니다.

media Hugging Face Forums · 18일 전 · 조회수 26회

Badaramoni이 혼합 LoRA 및 LoKR 어댑터를 병합하여 Krea 2 Turbo 사진 사실적 LoRA 출시

Badaramoni은 서로 다른 형식의 공개 리얼리즘 팩을 단일 파일로 결합하는 Krea-2-Turbo 모델용 새로운 어댑터를 출시했습니다. 이 릴리스는 표준 머저 도구가 동일한 저랭크 형식을 공유하지 않아 클래식 LoRA 및 LoKR 어댑터를 결합하지 못하는 한계를 해결합니다.

media Hugging Face Forums · 19일 전 · 조회수 13회

Diffusers-workflow가 MCP를 통해 에이전트가 GPU 이미지 및 비디오 생성을 주도하도록 함

Diffusers-workflow는 Hugging Face Diffusers 위에 구축된 선언형 엔진으로, 대규모 언어 모델 에이전트가 JSON 문서(파이썬 스크립트 대신)를 사용하여 이미지 또는 비디오 파이프라인을 작성, 검증, 실행 및 검사할 수 있게 합니다. 약 50개의 도구를 노출하는 MCP 서버를 주요 인터페이스로 제공하여 GPU 리소스에 대한 비감독 에이전트 제어를 가능하게 합니다.

lab Hugging Face Blog · 20일 전 · 조회수 29회

Gradio가 Workflow1111을 출시하여 AUTOMATIC1111 기능을 Gradio 그래프로 재구축

Gradio는 gr.Workflow 프레임워크를 사용하여 AUTOMATIC1111의 stable-diffusion-webui 기능 세트 대부분을 재구축한 프로젝트인 Workflow1111을 출시했습니다. 이 애플리케이션은 텍스트-이미지, 이미지-비디오, 다양한 전처리 작업을 아우르는 73개의 노드로 구성된 11개 미디어 파이프라인이 포함된 단일 캔버스로 구성됩니다.