xAI发布Imagine Image 2.0,具备精确编辑与排版能力
xAI已将Imagine Image 2.0作为新的质量模式以及iOS和Android应用全面开放。此次更新专注于为专业创意工作流提供精确的图像生成与编辑功能。
xAI已将Imagine Image 2.0作为新的质量模式以及iOS和Android应用全面开放。此次更新专注于为专业创意工作流提供精确的图像生成与编辑功能。
对DeepSeek v4 Flash模型的初步测试表明,其用户界面和用户体验设计技能有显著增强。尽管有这些改进,但该模型被指出非常消耗token。
研究人员提出了Cluster-Guided Vector Quantization (CGVQ),这是一种旨在提高基于高斯基元图像压缩率失真性能的方法。该方法在量化之前将高斯参数划分为同质组,解决了为每个基元存储大量浮点参数导致的低效问题。
Kavram 正在测试一个生产级图像生成 API,该 API 使用管道分割的分布式 GPU 网络,使开发人员能够在不自行管理硬件的情况下部署开源图像模型。
Hugging Face Diffusers 现在支持通过 `from_pretrained()` 原生加载 Nunchaku Lite 检查点,无需单独的推理引擎或本地 CUDA 编译。此集成利用 SVDQuant 方法运行具有 4-bit 权重和激活值(W4A4)的 Transformer 层,在显著降低内存使用的同时提高了推理速度。
微软发布了Mage-Flow,这是一个紧凑的4B规模生成堆栈,旨在实现高效的文本到图像生成和基于指令的图像编辑。该系统通过轻量级分词器Mage-VAE与原生分辨率多模态扩散Transformer(NR-MMDiT)的协同设计,实现了具有竞争力的顶尖质量。
NVIDIA推出了CTRL-G(Controllable Generative Graphics for Games),这是一个旨在解决在交互式游戏环境中控制生成式AI系统挑战的框架。
Google 发布了三款新模型:用于高效通用代理工作负载的 Gemini 3.6 Flash、用于低延迟应用的 3.5 Flash-Lite,以及与 CodeMender 集成的网络安全专用 3.5 Flash 模型。
Hugging Face 讨论区的一位用户正在请求社区识别 toyxyz 发布的对比图中用于“图 B”的具体艺术家标签。
NVIDIA 与 Hugging Face 已将 NVIDIA NeMo Automodel 集成至 🤗 Diffusers 库,为开源扩散模型提供生产级分布式训练。此次合作使用户能够在 Hugging Face Hub 上微调任何 Diffusers 格式模型,无需进行检查点转换或重写模型代码。
Hugging Face 论坛的一位用户正在询问是否为 FireRed Image Edit v1.1 模型开发 INT8 或 FP8 ConvRot 版本的潜力。
Simon Willison 演示了如何利用 OpenAI 的 GPT-5.6 Sol 模型和 gpt-image-2 API,为 Codex Desktop 应用程序创建自定义动画“宠物”。
为庆祝成立25周年,Google 推出了重新设计的 Google Images 主页,该主页支持浏览功能,同时在 AI Overviews 中新增了图像生成能力。
作者介绍了 CtrlVTON,这是一个解决虚拟试穿中用户控制缺失问题的框架,将任务重新定义为带有像素级分割掩码的图像编辑。这种方法允许用户指定服装的尺寸、风格以及在身体上的空间位置。
HoLo-FuSe 证明了一个冻结的、零参数的 HoLo Semantic Layer (HSL) 字节基底可以有效地为图像生成的扩散模型提供条件。该项目测试了这个确定性的 27-D 特征帧是否可以作为类别条件 DDPM 的条件机制,以取代传统的可学习嵌入。
开发者 ZimengXiong 完成了 Hunyuan3D-Paint 和 Hunyuan3D-Shape 模型的 Swift-MLX 和 Python MLX 移植,实现了在 Apple Silicon 设备上的本地图像到 3D 生成。该工作以开源 Modelr 桌面应用的形式分发,适用于 macOS 和 iOS,并附带将技术集成到 Swift 应用程序中的源代码。
Fabricio3g 发布了 Flaxeo Image,这是一个围绕最近的 sd.cpp 版本构建的本地桌面用户界面。该应用程序旨在暴露后端的大部分功能,包括生成、编辑、视频路径、模型管理和硬件选项。