xAI发布Imagine Image 2.0,具备精确编辑与排版能力
xAI已将Imagine Image 2.0作为新的质量模式以及iOS和Android应用全面开放。此次更新专注于为专业创意工作流提供精确的图像生成与编辑功能。
xAI已将Imagine Image 2.0作为新的质量模式以及iOS和Android应用全面开放。此次更新专注于为专业创意工作流提供精确的图像生成与编辑功能。
来自 Nvidia 的研究人员推出了 FusionRelight,这是一种用于人像重光照的方法,它将物理上合理的照明转移与身份保持以及紧凑的实时推理相结合。该方法利用混合领域知识融合(HDKF)训练框架,将合成数据、一次一盏光(OLAT)数据和真实场景数据中的物理、反射率和真实性先验蒸馏到一个学生模型中。
研究人员提出了Cluster-Guided Vector Quantization (CGVQ),这是一种旨在提高基于高斯基元图像压缩率失真性能的方法。该方法在量化之前将高斯参数划分为同质组,解决了为每个基元存储大量浮点参数导致的低效问题。
NVIDIA推出了CTRL-G(Controllable Generative Graphics for Games),这是一个旨在解决在交互式游戏环境中控制生成式AI系统挑战的框架。
Google 发布了三款新模型:用于高效通用代理工作负载的 Gemini 3.6 Flash、用于低延迟应用的 3.5 Flash-Lite,以及与 CodeMender 集成的网络安全专用 3.5 Flash 模型。
Google已在arXiv上发布了DiffusionGemma的技术报告。该文档详细介绍了作为Gemma系列一部分的模型架构和能力。
对DeepSeek v4 Flash模型的初步测试表明,其用户界面和用户体验设计技能有显著增强。尽管有这些改进,但该模型被指出非常消耗token。
Kavram 正在测试一个生产级图像生成 API,该 API 使用管道分割的分布式 GPU 网络,使开发人员能够在不自行管理硬件的情况下部署开源图像模型。
Hugging Face Diffusers 现在支持通过 `from_pretrained()` 原生加载 Nunchaku Lite 检查点,无需单独的推理引擎或本地 CUDA 编译。此集成利用 SVDQuant 方法运行具有 4-bit 权重和激活值(W4A4)的 Transformer 层,在显著降低内存使用的同时提高了推理速度。
微软发布了Mage-Flow,这是一个紧凑的4B规模生成堆栈,旨在实现高效的文本到图像生成和基于指令的图像编辑。该系统通过轻量级分词器Mage-VAE与原生分辨率多模态扩散Transformer(NR-MMDiT)的协同设计,实现了具有竞争力的顶尖质量。
NVIDIA 与 Hugging Face 已将 NVIDIA NeMo Automodel 集成至 🤗 Diffusers 库,为开源扩散模型提供生产级分布式训练。此次合作使用户能够在 Hugging Face Hub 上微调任何 Diffusers 格式模型,无需进行检查点转换或重写模型代码。
Hugging Face 论坛的一位用户正在询问是否为 FireRed Image Edit v1.1 模型开发 INT8 或 FP8 ConvRot 版本的潜力。
Hugging Face 讨论区的一位用户正在请求社区识别 toyxyz 发布的对比图中用于“图 B”的具体艺术家标签。