xAI가 정밀 편집 및 레이아웃 기능을 갖춘 Imagine Image 2.0 출시
xAI는 새로운 Quality Mode와 iOS, Android 앱을 통해 Imagine Image 2.0을 일반 공개했습니다. 이번 업데이트는 전문적인 크리에이티브 워크플로우를 위한 정밀한 이미지 생성 및 편집에 중점을 둡니다.
xAI는 새로운 Quality Mode와 iOS, Android 앱을 통해 Imagine Image 2.0을 일반 공개했습니다. 이번 업데이트는 전문적인 크리에이티브 워크플로우를 위한 정밀한 이미지 생성 및 편집에 중점을 둡니다.
DeepSeek v4 Flash 모델에 대한 초기 테스트는 사용자 인터페이스 및 사용자 경험 디자인 기술에서 눈에 띄는 향상을 나타냅니다. 이러한 개선에도 불구하고 이 모델은 토큰을 많이 소비하는 것으로 지적되었습니다.
연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.
Kavram은 개발자가 하드웨어를 직접 관리하지 않고 오픈 이미지 모델을 배포할 수 있도록 파이프라인 분할 분산 GPU 네트워크를 사용하는 프로덕션 이미지 생성 API를 테스트 중입니다.
Hugging Face Diffusers는 이제 `from_pretrained()`를 통해 Nunchaku Lite 체크포인트를 네이티브로 로드할 수 있게 되어 별도의 추론 엔진이나 로컬 CUDA 컴파일이 필요하지 않게 되었습니다. 이 통합은 SVDQuant 방법을 사용하여 4비트 가중치와 활성화(W4A4)로 트랜스포머 레이어를 실행하며, 메모리 사용량을 크게 줄이는 동시에 추론 속도를 향상시킵니다.
Microsoft는 효율적인 텍스트-이미지 생성과 지시 기반 이미지 편집을 위해 설계된 경량 4B 규모 생성 스택인 Mage-Flow를 출시했습니다. 이 시스템은 경량 토크나이저인 Mage-VAE와 네이티브 해상도 멀티모달 디퓨전 트랜스포머(NR-MMDiT)의 공동 설계를 통해 최첨단 경쟁 수준의 품질을 달성합니다.
NVIDIA는 상호작용형 게임 환경 내에서 생성형 AI 시스템을 제어하는 과제를 해결하기 위해 설계된 프레임워크인 CTRL-G(Controllable Generative Graphics for Games)를 출시했습니다.
구글은 효율적인 범용 에이전트 워크로드를 위한 Gemini 3.6 Flash, 낮은 지연 시간 애플리케이션을 위한 3.5 Flash-Lite, 그리고 CodeMender와 통합된 사이버 전문 3.5 Flash 모델을 포함한 세 가지 새로운 모델을 출시했습니다.
Hugging Face 토론 포럼의 한 사용자가 toyxyz가 게시한 비교 이미지에 사용된 "그림 B"의 특정 아티스트 태그를 커뮤니티가 식별해 줄 것을 요청하고 있습니다.
NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.
Hugging Face 포럼의 한 사용자가 FireRed Image Edit v1.1 모델에 대한 INT8 또는 FP8 ConvRot 버전의 잠재적 개발에 대해 문의하고 있습니다.
Simon Willison은 OpenAI의 GPT-5.6 Sol 모델과 gpt-image-2 API를 활용하여 Codex Desktop 애플리케이션용 사용자 정의 애니메이션 "펫"을 만드는 방법을 시연합니다.
설립 25주년을 기념하여 Google은 Google Images를 위한 재설계된 브라우징 가능한 홈과 AI Overviews 내의 새로운 이미지 생성 기능을 출시합니다.
저자들은 CtrlVTON이라는 프레임워크를 소개합니다. 이는 가상 피팅에서의 사용자 제어 부족 문제를 해결하기 위해 작업을 픽셀 수준 분할 마스크를 사용한 이미지 편집으로 재정의합니다. 이 접근 방식을 통해 사용자는 의류의 크기, 스타일 및 신체 상의 공간적 배치를 지정할 수 있습니다.
HoLo-FuSe는 동결된 0-파라미터 HoLo Semantic Layer (HSL) 바이트 기판이 이미지 생성을 위한 확산 모델을 효과적으로 조건화할 수 있음을 입증했습니다. 이 프로젝트는 이 결정론적인 27-D 특징 프레임이 전통적인 학습 임베딩을 대체하여 클래스 조건부 DDPM의 조건화 메커니즘으로 기능할 수 있는지 테스트합니다.
개발자 ZimengXiong은 Hunyuan3D-Paint 및 Hunyuan3D-Shape 모델에 대한 Swift-MLX 및 Python MLX 포트를 완료하여 Apple Silicon 장치에서 로컬 이미지-3D 생성을 가능하게 했습니다. 이 작업은 macOS 및 iOS용 오픈소스 Modelr 데스크톱 앱으로 배포되며, Swift 애플리케이션에 기술을 통합하기 위한 소스 코드도 포함되어 있습니다.
Fabricio3g는 최근 sd.cpp 릴리스를 중심으로 구축된 로컬 데스크톱 사용자 인터페이스인 Flaxeo Image를 출시했습니다. 이 애플리케이션은 생성, 편집, 비디오 경로, 모델 관리 및 하드웨어 옵션을 포함하여 백엔드의 대부분의 기능을 노출하는 것을 목표로 합니다.