Local inference
github llama.cpp · 17時間前 · 9 回表示

llama.cppがHunyuanOCRのDFlashサポートを追加し、ドラフト変換を修正

llama.cppプロジェクトは、ターゲットグラフ内のレイヤー入力テンソルを公開することで、HunyuanOCRモデルとのDFlash推測デコーディングのサポートを追加しました。この変更により、ドラフトモデルが残差ストリームを読み取れるようになり、非推測実行と比較して約0.5のドラフト受容率とバイトレベルで同一のOCR出力を得ながら、画像リクエストを正常に実行できるようになりました。

lab Hugging Face Blog · 21時間前 · 10 回表示

Transformersがggmlカーネル経由でGGUFサポートを追加し、ローカル推論に対応

Hugging FaceのTransformersライブラリは、基盤となるggmlカーネルを活用してllama.cppに近いパフォーマンスを実現しつつ、GGUF量子化モデルの読み込みをサポートするようになりました。この統合により、開発者は対応ハードウェア上で標準的なPyTorchベースのAPI内で量子化済みチェックポイントを直接実行できます。

lab Hugging Face Blog · 1日前 · 11 回表示

oMLXのクリエイターであるJun KimがHugging Faceに参加し、MLXコミュニティをサポート

oMLXのクリエイターかつメンテナーであるJun Kimが、MLXコミュニティをサポートするためにHugging Faceに入社しました。この動きは、サイドプロジェクトから完全に維持・資金提供されたイニシアチブへと移行することで、オープンソースプロジェクトに安定性とより迅速な開発を提供することを目指しています。

media Hugging Face Forums · 1日前 · 11 回表示

ユーザーはローカルでのギリシャ語利用向けにLlama-Krikri-8B-Instructをアンラーニングするワークフローを求めている

あるユーザーは、ilsp/Llama-Krikri-8B-Instructのチェックポイントを使用して、ローカルデプロイ向けの無制限なギリシャ語ネイティブの大規模言語モデルを構築する計画を立てています。提案された計画には、Heretic (heretic-llm) を用いてモデルをアンラーニングし、GGUF Q4_K_M形式に変換し、AMD Ryzen AI MAX+ 395プロセッサとVulkanを搭載したGMKtec EVO-X3で推論を実行することが含まれます。

github llama.cpp · 2日前 · 12 回表示

llama.cpp b11081 リリース:構成可能なテンソルデータ標準偏差と改善されたテストツール

llama.cpp プロジェクトは、`test-llama-archs` テストインフラストラクチャのいくつかの更新を含むビルド b11081 をリリースしました。主な変更点には、テンソルデータの標準偏差を構成可能にすること、使用例の拡大、およびアーキテクチャ正規表現パターンのサポート追加が含まれます。