OpenAI, 더 선명한 디테일과 빠른 생성, 새로운 편집 도구를 갖춘 ChatGPT Images 2.5 출시
OpenAI는 이전 버전 대비 더 선명한 디테일, 더 정밀한 편집 기능, 최대 50% 빠른 생성 속도를 제공하는 최신 이미지 모델인 ChatGPT Images 2.5를 출시했습니다.
OpenAI는 이전 버전 대비 더 선명한 디테일, 더 정밀한 편집 기능, 최대 50% 빠른 생성 속도를 제공하는 최신 이미지 모델인 ChatGPT Images 2.5를 출시했습니다.
영화 제작자 Liz Garbus 및 Primordial Soup와의 협력으로 Google DeepMind은 단편 다큐멘터리 "Love, Rendered"를 위해 Burt와 Ethelle Shatz의 촬영되지 않은 만남을 재구성하기 위해 생성형 AI 모델을 사용했습니다. 이 프로젝트는 부부의 마음속에만 존재했던 특정 기억을 재현하여 인지 감퇴에 대응합니다.
Google은 향후 몇 주 동안 모든 Google AI Pro 및 Ultra 구독자와 대부분의 Workspace 비즈니스 고객에게 Nano Banana 모델을 기반으로 한 이미지 생성 및 편집 도구인 Google Pics를 롤아웃하고 있습니다.
연구자들은 기본 모델을 동결한 채로 에이전트 기반 다중 참조 이미지 생성을 위한 실행 하니스를 자동으로 최적화하는 방법인 AutoRef를 제안합니다. 코딩 에이전트는 주체 누락과 부자연스러운 구성과 같은 과제를 해결하기 위해 하니스 코드를 반복적으로 다시 작성합니다.
VNU-HCM 정보기술대학원 석사 과정 학생인 Hung Tran은 "The Clipping Trap: A Silent Failure Mode in Overfitted Neural Image Codecs"라는 논문의 코드와 데이터를 공개했습니다. 이 연구는 Cool-chic 및 C3와 같은 과적합된 코덱이 특정 콘텐츠 유형에서 왜곡 기울기가 0인 평탄한 색상의 이미지를 생성할 수 있는 방법을 강조합니다.
이번 업데이트는 AI 환경의 여러 발전을 다루며, 메타가 Muse 플랫폼을 서드파티 개발자에게 개방하고, 세그멘테이션 모델의 새 버전을 출시하며, Google의 Gemini와 관련된 보안 사고를 포함합니다.
알리바바의 Qwen 팀은 이전의 별도 체크포인트를 단일 7B 파라미터 디퓨전 트랜스포머로 통합한 텍스트-이미지 생성 및 이미지 편집용 통합 모델인 Qwen-Image-2.1을 출시했습니다.
Qwen은 이미지 생성 및 편집 모두를 위해 설계된 통합 모델인 오픈 웨이트 Qwen-Image-2.1을 출시했습니다.
Badaramoni은 서로 다른 형식의 공개 리얼리즘 팩을 단일 파일로 결합하는 Krea-2-Turbo 모델용 새로운 어댑터를 출시했습니다. 이 릴리스는 표준 머저 도구가 동일한 저랭크 형식을 공유하지 않아 클래식 LoRA 및 LoKR 어댑터를 결합하지 못하는 한계를 해결합니다.
Diffusers-workflow는 Hugging Face Diffusers 위에 구축된 선언형 엔진으로, 대규모 언어 모델 에이전트가 JSON 문서(파이썬 스크립트 대신)를 사용하여 이미지 또는 비디오 파이프라인을 작성, 검증, 실행 및 검사할 수 있게 합니다. 약 50개의 도구를 노출하는 MCP 서버를 주요 인터페이스로 제공하여 GPU 리소스에 대한 비감독 에이전트 제어를 가능하게 합니다.
Gradio는 gr.Workflow 프레임워크를 사용하여 AUTOMATIC1111의 stable-diffusion-webui 기능 세트 대부분을 재구축한 프로젝트인 Workflow1111을 출시했습니다. 이 애플리케이션은 텍스트-이미지, 이미지-비디오, 다양한 전처리 작업을 아우르는 73개의 노드로 구성된 11개 미디어 파이프라인이 포함된 단일 캔버스로 구성됩니다.
한 사용자가 INT4 양자화를 사용하여 NVIDIA의 640억 파라미터 Cosmos3 모델을 로컬에서 실행하기 위한 코드와 가중치를 게시했습니다. 이 구현은 Apple Silicon에서 MLX를 통해, 그리고 CUDA에서도 텍스트-투-이미지 및 이미지-투-비디오 작업을 지원합니다.
OpenAI는 이미지 생성 모델의 업데이트인 ChatGPT Images 2.5를 출시했으며, 이는 여러 턴에 걸쳐 지시를 따르는 능력을 향상시키고 응답 속도를 높입니다. 새 버전은 사용자가 제공한 참조 사진에서 피사체를 보존하는 능력도 더 뛰어납니다.
한 엔지니어가 JavaScript와 강화학습을 활용해 수채화를 그리는 코딩 모델을 훈련하는 Surya Narreddi의 바이럴 프로젝트를 복제해 오픈소스로 공개했다. 이 구현은 TRL 라이브러리와 OpenEnv를 활용하여 Hugging Face 위에서 훈련, 평가, 추론을 위한 엔드투엔드 파이프라인을 구축한다.