Tema · Image generation
lab Google — The Keyword (AI) · há 21 d · 41 visualizações

Google DeepMind usa IA para recriar memória não gravada de um casal para documentário

Em colaboração com a cineasta Liz Garbus e a Primordial Soup, o Google DeepMind utilizou modelos de IA generativa para reconstruir um encontro não fotografado entre Burt e Ethelle Shatz para o curta-metragem documental "Love, Rendered". O projeto aborda o declínio cognitivo recriando uma memória específica que existia apenas na mente do casal.

arxiv arXiv cs.AI · há 1 d Multi-SWE-bench · 7.37% · 1 visualização

AutoRef otimiza o arnés de agentes para geração de imagens com múltiplas referências

Pesquisadores propõem o AutoRef, um método que otimiza automaticamente o arnés de execução para geração de imagens com múltiplas referências por agentes, mantendo os modelos subjacentes congelados. Um agente de codificação reescreve iterativamente o código do arnés para abordar desafios como omissão de sujeitos e composições antinaturais.

media Hugging Face Forums · há 3 d · 4 visualizações

Hung Tran identifica armadilha de clippagem em codecs neurais de imagem superajustados

Hung Tran, estudante de mestrado da Universidade de Tecnologia da Informação (VNU-HCM), publicou código e dados para seu artigo "The Clipping Trap: A Silent Failure Mode in Overfitted Neural Image Codecs." O trabalho destaca como codecs superajustados, como Cool-chic e C3, podem produzir imagens com cores planas e gradientes de distorção zero em tipos específicos de conteúdo.

media Hugging Face Forums · há 19 d · 13 visualizações

Diffusers-workflow permite que agentes direcionem a geração de imagens e vídeos em GPU via MCP

O Diffusers-workflow é um mecanismo declarativo construído sobre o Hugging Face Diffusers que permite que agentes de modelos de linguagem grandes (LLMs) criem, validem, executem e inspecionem pipelines de imagem ou vídeo usando documentos JSON em vez de scripts Python. Ele expõe um servidor MCP com aproximadamente 50 ferramentas como interface principal, permitindo controle não supervisionado de agentes sobre recursos de GPU.

lab Hugging Face Blog · há 20 d · 29 visualizações

Gradio lança Workflow1111, reconstruindo recursos do AUTOMATIC1111 como um grafo Gradio

O Gradio lançou o Workflow1111, um projeto que reconstrói a maioria do conjunto de recursos do stable-diffusion-webui do AUTOMATIC1111 usando o framework gr.Workflow. O aplicativo consiste em uma única tela contendo onze pipelines de mídia construídos a partir de setenta e três nós, abrangendo texto-para-imagem, imagem-para-vídeo e várias tarefas de pré-processamento.