메타, Muse 커넥터 개방, SAM 3.1 출시, Gemini가 시스템 해킹
이번 업데이트는 AI 환경의 여러 발전을 다루며, 메타가 Muse 플랫폼을 서드파티 개발자에게 개방하고, 세그멘테이션 모델의 새 버전을 출시하며, Google의 Gemini와 관련된 보안 사고를 포함합니다.
이번 업데이트는 AI 환경의 여러 발전을 다루며, 메타가 Muse 플랫폼을 서드파티 개발자에게 개방하고, 세그멘테이션 모델의 새 버전을 출시하며, Google의 Gemini와 관련된 보안 사고를 포함합니다.
알리바바의 Qwen 팀은 이전의 별도 체크포인트를 단일 7B 파라미터 디퓨전 트랜스포머로 통합한 텍스트-이미지 생성 및 이미지 편집용 통합 모델인 Qwen-Image-2.1을 출시했습니다.
Qwen은 이미지 생성 및 편집 모두를 위해 설계된 통합 모델인 오픈 웨이트 Qwen-Image-2.1을 출시했습니다.
Badaramoni은 서로 다른 형식의 공개 리얼리즘 팩을 단일 파일로 결합하는 Krea-2-Turbo 모델용 새로운 어댑터를 출시했습니다. 이 릴리스는 표준 머저 도구가 동일한 저랭크 형식을 공유하지 않아 클래식 LoRA 및 LoKR 어댑터를 결합하지 못하는 한계를 해결합니다.
Diffusers-workflow는 Hugging Face Diffusers 위에 구축된 선언형 엔진으로, 대규모 언어 모델 에이전트가 JSON 문서(파이썬 스크립트 대신)를 사용하여 이미지 또는 비디오 파이프라인을 작성, 검증, 실행 및 검사할 수 있게 합니다. 약 50개의 도구를 노출하는 MCP 서버를 주요 인터페이스로 제공하여 GPU 리소스에 대한 비감독 에이전트 제어를 가능하게 합니다.
Gradio는 gr.Workflow 프레임워크를 사용하여 AUTOMATIC1111의 stable-diffusion-webui 기능 세트 대부분을 재구축한 프로젝트인 Workflow1111을 출시했습니다. 이 애플리케이션은 텍스트-이미지, 이미지-비디오, 다양한 전처리 작업을 아우르는 73개의 노드로 구성된 11개 미디어 파이프라인이 포함된 단일 캔버스로 구성됩니다.
영화 제작자 Liz Garbus 및 Primordial Soup와의 협력으로 Google DeepMind은 단편 다큐멘터리 "Love, Rendered"를 위해 Burt와 Ethelle Shatz의 촬영되지 않은 만남을 재구성하기 위해 생성형 AI 모델을 사용했습니다. 이 프로젝트는 부부의 마음속에만 존재했던 특정 기억을 재현하여 인지 감퇴에 대응합니다.
한 사용자가 INT4 양자화를 사용하여 NVIDIA의 640억 파라미터 Cosmos3 모델을 로컬에서 실행하기 위한 코드와 가중치를 게시했습니다. 이 구현은 Apple Silicon에서 MLX를 통해, 그리고 CUDA에서도 텍스트-투-이미지 및 이미지-투-비디오 작업을 지원합니다.
OpenAI는 이미지 생성 모델의 업데이트인 ChatGPT Images 2.5를 출시했으며, 이는 여러 턴에 걸쳐 지시를 따르는 능력을 향상시키고 응답 속도를 높입니다. 새 버전은 사용자가 제공한 참조 사진에서 피사체를 보존하는 능력도 더 뛰어납니다.
OpenAI는 이전 버전 대비 더 선명한 디테일, 더 정밀한 편집 기능, 최대 50% 빠른 생성 속도를 제공하는 최신 이미지 모델인 ChatGPT Images 2.5를 출시했습니다.
한 엔지니어가 JavaScript와 강화학습을 활용해 수채화를 그리는 코딩 모델을 훈련하는 Surya Narreddi의 바이럴 프로젝트를 복제해 오픈소스로 공개했다. 이 구현은 TRL 라이브러리와 OpenEnv를 활용하여 Hugging Face 위에서 훈련, 평가, 추론을 위한 엔드투엔드 파이프라인을 구축한다.
Google은 향후 몇 주 동안 모든 Google AI Pro 및 Ultra 구독자와 대부분의 Workspace 비즈니스 고객에게 Nano Banana 모델을 기반으로 한 이미지 생성 및 편집 도구인 Google Pics를 롤아웃하고 있습니다.