Inference efficiency
arxiv arXiv cs.AI · 4時間前 · 9 回表示

CliffCompactionはパフォーマンスを維持しながらコーディングエージェントのコストを50%削減

研究者らは、有界コンテキスト下で長期のコーディングエージェントのコストを最大50%削減するために設計された自動圧縮手法であるCliffCompactionを発表した。この手法は、再表現ではなく切り捨てを通じて圧縮された情報の忠実性を保つことで、Terminal-Benchでのパフォーマンスを維持または向上させ、KernelBenchで最先端の結果を達成している。

lab OpenAI News · 11時間前 · 16 回表示

GPT-6 Astra で研究時間とコストを半減

Parallel は OpenAI の GPT-6 Astra を AI エージェントインフラストラクチャに統合し、以前のモデルと比較して研究時間とコードコストの両方を 50% 削減することに成功しました。同社は、新モデルによりエージェントが複雑な知識作業を大幅に高速化しながら、高品質な出力を維持できると報告しています。

github llama.cpp · 17時間前 · 9 回表示

llama.cppがHunyuanOCRのDFlashサポートを追加し、ドラフト変換を修正

llama.cppプロジェクトは、ターゲットグラフ内のレイヤー入力テンソルを公開することで、HunyuanOCRモデルとのDFlash推測デコーディングのサポートを追加しました。この変更により、ドラフトモデルが残差ストリームを読み取れるようになり、非推測実行と比較して約0.5のドラフト受容率とバイトレベルで同一のOCR出力を得ながら、画像リクエストを正常に実行できるようになりました。

lab Hugging Face Blog · 21時間前 · 10 回表示

Transformersがggmlカーネル経由でGGUFサポートを追加し、ローカル推論に対応

Hugging FaceのTransformersライブラリは、基盤となるggmlカーネルを活用してllama.cppに近いパフォーマンスを実現しつつ、GGUF量子化モデルの読み込みをサポートするようになりました。この統合により、開発者は対応ハードウェア上で標準的なPyTorchベースのAPI内で量子化済みチェックポイントを直接実行できます。

media Hugging Face Forums · 1日前 · 11 回表示

ユーザーはローカルでのギリシャ語利用向けにLlama-Krikri-8B-Instructをアンラーニングするワークフローを求めている

あるユーザーは、ilsp/Llama-Krikri-8B-Instructのチェックポイントを使用して、ローカルデプロイ向けの無制限なギリシャ語ネイティブの大規模言語モデルを構築する計画を立てています。提案された計画には、Heretic (heretic-llm) を用いてモデルをアンラーニングし、GGUF Q4_K_M形式に変換し、AMD Ryzen AI MAX+ 395プロセッサとVulkanを搭載したGMKtec EVO-X3で推論を実行することが含まれます。

media Together AI Blog · 1日前 · 11 回表示

Together AIがCanary展開を導入、ダウンタイムなしで本番環境のモデルをアップグレード

Together AIは、Canary展開という機能を導入しました。これは、ゲート付きの段階的なステップで、現在のモデルから新しいチェックポイントへライブトラフィックを移行する機能です。このシステムは、ヘルスチェックとオプションのメトリックゲートを走行させてトラフィックを移動する前に実行することで、モデルの切り替えにおける安全策を自動化し、パフォーマンスが低下した場合に自動停止や巻き戻しを可能にします。

arxiv arXiv cs.AI · 1日前 · 9 回表示

AgentRouterはステップレベルのモデルルーティングにより、エージェントワークフローのコストを72%削減

研究者らは、エージェントRouterを提案した。これは軽量な分類器であり、すべてのタスクに最先端モデルを使用するのではなく、個々の軌跡のステップを適切なモデルティアにルーティングすることで、マルチステップのエージェントワークフローを最適化する。

arxiv arXiv cs.CL · 1日前 · 11 回表示

AgentRouterがステップレベルのモデルルーティングによりエージェントワークフローのコストを72%削減

研究者らは、単一の最先端モデルをすべてのタスクに使用するのではなく、個々の軌跡のステップを適切なモデル階層にルーティングすることで、マルチステップのエージェントワークフローを最適化する軽量な分類器であるAgentRouterを提案している。このシステムは、より小さなモデルでも同等に処理できるサブタスクに対して推論予算の60〜80%を浪費するエンタープライズシステムの非効率性に対処する。