過去1ヶ月間で中国で4つの大規模言語モデルがリリースされました:Kimi K3-2.8T、Qwen3.8-2.4T、DeepSeek-V4-Pro-0813-1.6T、GLM-5.3-743B。
media
r/LocalLLaMA
·
8時間前
·
open_models
Kimi K3、Qwen3.8、DeepSeek-V4-Pro-0813、GLM-5.3 が1ヶ月以内にリリース
翻訳元 English → 日本語
関連記事
media
AI News (smol.ai)
·
2日前
·
11 回表示
xAIがGrok 4.6をリリース;AlibabaがQwen3.8-MoEを公開;DeepSeek V4 Pro GA
今週のAIニュースでは、xAI、Alibaba、DeepSeekからの主要なリリースに加え、オープンビジョンモデルや推論インフラのアップデートも注目されています。
media
Interconnects
·
12日前
·
11 回表示
Thinking MachinesがInklingをリリース、TencentがHy3をApache 2.0ライセンスで更新
最新のオープンモデル成果物のまとめでは、Thinking MachinesとTencentによる重要なリリース、およびPoolsideとDeepSeekのアップデートが注目されています。
media
TLDR AI
·
25日前
·
6 回表示
Qwen3.8のオープンウェイトリリース、Kimi Code CLI、NetflixのLLMスタック、アリババのチップソフトウェア
アリババは2.4兆パラメータのモデルであるQwen3.8のオープンウェイトリリースを発表するとともに、NvidiaのCUDAエコシステムへの依存を軽減するため、Zhenwu AIチップのソフトウェアスタックをオープンソース化した。
media
MarkTechPost
·
27日前
·
24 回表示
ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2
Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。
arxiv
arXiv cs.CL
·
36日前
deepseek-r1:8B を Qwen3-0.6B に蒸留することで、高速なオンデバイス構造化テキストの拡張が可能に
研究者たちは、8B の推論教師モデル (deepseek-r1:8B) を 0.6B の学生モデル (QLoRA を介した Qwen3-0.6B) に蒸留することで、大幅なレイテンシとコストの削減を実現しつつ、高ボリュームの構造化抽出を可能であることを実証しました。この手法は、要約とカテゴリラベルを含む JSON オブジェクトへのニュース記事のマッピングについて評価され、蒸留モデルがファショットプロンプティングや制約付きデコーディングのベースラインと比較されました。