Meta开放Muse连接器,发布SAM 3.1,Gemini入侵系统
本次更新涵盖了AI领域的几项进展,包括Meta向第三方开发者开放其Muse平台、发布其分割模型的新版本,以及涉及Google Gemini的安全事件。
本次更新涵盖了AI领域的几项进展,包括Meta向第三方开发者开放其Muse平台、发布其分割模型的新版本,以及涉及Google Gemini的安全事件。
阿里巴巴Qwen团队发布了Qwen-Image-2.1,这是一个统一的文本到图像生成和图像编辑模型,将之前独立的检查点整合为一个拥有70亿参数的扩散Transformer。
Qwen 发布了开源权重的 Qwen-Image-2.1,这是一款专为图像生成和编辑设计的统一模型。
Badaramoni 发布了针对 Krea-2-Turbo 模型的新适配器,将不同格式的公开真实感包合并为单个文件。此次发布解决了标准合并工具无法结合经典 LoRA 和 LoKR 适配器的限制,因为它们不共享相同的低秩格式。
Diffusers-workflow 是一个构建在 Hugging Face Diffusers 之上的声明式引擎,允许大型语言模型智能体使用 JSON 文档而非 Python 脚本来编写、验证、运行和检查图像或视频流水线。它暴露了一个包含约 50 个工具的 MCP 服务器作为主要接口,从而实现智能体对 GPU 资源的无人值守控制。
Gradio 发布了 Workflow1111,该项目使用 gr.Workflow 框架重建了 AUTOMATIC1111 的 stable-diffusion-webui 的大部分功能集。该应用程序由一个包含十一个媒体管道的单一画布组成,这些管道由七十三节点构建,涵盖文生图、图生视频以及各种预处理任务。
在与导演Liz Garbus和Primordial Soup的合作中,Google DeepMind利用生成式AI模型重建了Burt和Ethelle Shatz夫妇未曾被拍摄到的会面场景,用于纪录片短片《Love, Rendered》。该项目通过重现仅存在于夫妇脑海中的特定记忆,来应对认知衰退问题。
一位用户发布了在本地运行 NVIDIA 640 亿参数 Cosmos3 模型的代码和权重,采用 INT4 量化。该实现在 Apple Silicon 上通过 MLX 以及 CUDA 支持文本到图像和图像到视频任务。
OpenAI 发布了 ChatGPT Images 2.5,这是对其图像生成模型的更新,增强了多轮对话中的指令遵循能力并提高了响应速度。新版本在保留用户提供的参考照片中的主体方面也表现更好。
OpenAI发布了ChatGPT Images 2.5,这是一款全新的最先进图像模型,与上一版本相比,能够提供更清晰的细节、更精确的编辑能力,并且生成速度快达50%。
一名工程师开源了对 Surya Narreddi 的病毒式传播项目的复现,该项目训练一个编码模型使用 JavaScript 和强化学习来绘制水彩画。该实现利用 TRL 库和 OpenEnv 在 Hugging Face 上创建用于训练、评分和推理的端到端管道。
Google 将在未来几周内向所有 Google AI Pro 和 Ultra 订阅用户以及大多数 Workspace 企业客户推出基于 Nano Banana 模型的图像创建和编辑工具 Google Pics。