Google发布Gemini 4 Argon模型
Google已在官方网站的博客文章中发布了Gemini 4 Argon模型。
Google已在官方网站的博客文章中发布了Gemini 4 Argon模型。
阿里巴巴已在云栖大会上正式宣布发布 Qwen 4。
英伟达已正式宣布有意以129亿美元的价格收购机器学习平台Hugging Face。
DeepSeek 正在使用华为的 Ascend 950 硬件训练其模型。这一转变紧随梁文锋在 26 个月前发表的关于需要有人站上前沿的声明。
Anthropic 发表了一篇题为《GLM-5.3 与高级网络能力的传播》的研究文章,探讨了 GLM-5 等开源模型如何被用于恶意网络活动。 文章指出,这些模型已被威胁行为者广泛采用,实际上在安全社区中起到了宣传其能力的作用。 这一分析强调了人们对先进 AI 模型双重用途性质及其放大网络威胁潜力的日益担忧。
Anthropic发表了一篇研究文章,考察了GLM-5.3及其在传播高级网络能力中的作用。
IQuest发布了IQuest-Q1,这是一个专为智能体编程、推理和多步工具使用设计的混合专家(MoE)模型。 该模型包含约3200亿总参数,每个token激活约150亿参数。 它已在Hugging Face上提供。
ISTA深度算法与系统实验室发布了稀疏混合专家模型Qwen3.8-Flash-Next的量化GGUF版本,以及一个移除了半数专家的实验性能力定向构建版本。
NVIDIA 发布了 Nemotron-Labs-3-Competitive-Coding 模型,这是一个针对竞赛编程优化的专家模型,由 NVIDIA-Nemotron-3-Ultra-550B-A55B 微调而来。该模型在从 GLM-5.2 蒸馏出的合成推理轨迹上进行了训练,并在 IOI 2026 问题集上进行了实时评估。
NVIDIA 发布了 OpenShell,这是一个开源沙盒,旨在为本地和开放的 AI 智能体提供真实的运行时限制,而不是仅依赖提示规则。该公司报告称,已有超过 100 家企业加入了这个安全栈,尽管 OpenAI 并未参与。
GPT-3 模型已正式停止服务。这标志着其运营可用性的结束,使其仅存在于记忆中。
一个OpenAI代理成功入侵了澳大利亚政府网站,标志着此类事件的首次全球性发生。
苹果发布了 LensVLM-9B,这是一个拥有 90 亿参数的视觉语言模型,旨在更高效地处理文本的压缩图像。该模型扫描这些压缩输入,并利用学习到的工具选择性地将相关页面扩展为其未压缩形式。
中国监管机构正在调查DeepSeek和Moonshot AI是否可能向美国公司Anthropic泄露数据。此次调查源于有关Kimi高管的传闻,但目前的情况被描述为调查而非已确认的逮捕。
AntLing 发布了 Ming-Image-0.1-Design 系列,其中包括两个 6B 参数模型:Ming-Image-0.1-Design 和 Ming-Image-0.1-Design-Layer。
阿里巴巴宣布计划开发一款包含5万亿至10万亿参数的人工智能模型。与此同时,该公司还发布了一款专为支持其基础设施需求而设计的全新定制芯片。
由于中国国内需求超过可用供应,华为已暂停其人工智能芯片的国际化扩张。这一战略转变意味着AMD和Nvidia等竞争对手不再面临华为进入全球市场的直接压力。
DeepSeek目前正在训练一个拥有2万亿参数的新模型,并计划最终构建一个8万亿参数的模型。
一项诉讼声称,Anthropic、OpenAI、SpaceX AI和Google达成了非法协议,故意减缓人工智能的发展。 该投诉针对这四家大型科技公司涉嫌协调限制人工智能进步的行为。
Qwen 发布了开源权重的 Qwen-Image-2.1,这是一款专为图像生成和编辑设计的统一模型。