← 戻る media r/LocalLLaMA · 6時間前 · open_models pipecat-ai、GPT 5.6 Terra パフォーマンスを持つ phonellm-alpha-1 をリリース 翻訳元 English → 日本語 pipecat-ai プロジェクトは、典型的な音声エージェントタスクで GPT 5.6 に匹敵するパフォーマンスを達成する phonellm-alpha-1 モデルをリリースしました。 このモデルは比較ベースラインの三分の一のレイテンシで動作します。コストは参照ソリューションの約十八分の一です。 重要度 2/3 r/LocalLLaMA Inference efficiency Voice & audio 原文を読む 関連記事 github llama.cpp · 19日前 · 12 回表示 llama.cpp b10369がpocket-ttsサポートを追加し、CUDA生成が80%高速化 llama.cppプロジェクトはビルドb10369をリリースし、pocket-tts テキスト読み上げモデルのサポートを導入しました。このアップデートには、パフォーマンスを最適化するためにGEMMとcol2imを使用した転置畳み込みの新しい実装が含まれています。 media r/LocalLLaMA · 48日前 · 13 回表示 audio.cpp 0.3がSupertonic 3、MOSS-TTS、IndexTTS2、Irodori-TTSをGGUFサポート付きで追加 audio.cppプロジェクトはバージョン0.3をリリースし、5つの新しいテキスト音声変換モデル(Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2、Irodori-TTS)を導入しました。このアップデートではGGUFサポートも追加され、モデルごとに順次展開されます。 media r/LocalLLaMA · 52日前 · 10 回表示 Qwen3-ASRとKokoro-TTSのONNX版がCPU上で動作し、GPU不要の音声アシスタントを実現 あるユーザーは、音声アシスタントのパイプラインにおいてGPUからオフロードできる処理負荷を把握するため、CPU上でONNXモデルとして動作するQwen3-ASRとKokoro-TTSのレイテンシをテストした。 media r/LocalLLaMA · 53日前 · 20 回表示 audio.cppにストリーミングサポートとNemotron 3.5 ASRが追加 audio.cppプロジェクトは、音声認識および合成のための初期ストリーミングサポートと、4つの新しいASR/STTモデル(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR、Hviske ASR)を含むネイティブC++/GGMLフレームワークを更新しました。 media r/LocalLLaMA · 55日前 · 15 回表示 開発者がオンデバイスQwen3 TTS推論用のAndroidアプリを構築 ある開発者は、モバイルデバイス上でQwen3TTS 0.6Bモデルをローカルで実行するAndroidアプリケーションを作成しました。このアプリは、クラウドへの依存なしにテキストから音声への変換処理を可能にするために、カスタムGGMLベースのC++バックエンドを利用しています。
github llama.cpp · 19日前 · 12 回表示 llama.cpp b10369がpocket-ttsサポートを追加し、CUDA生成が80%高速化 llama.cppプロジェクトはビルドb10369をリリースし、pocket-tts テキスト読み上げモデルのサポートを導入しました。このアップデートには、パフォーマンスを最適化するためにGEMMとcol2imを使用した転置畳み込みの新しい実装が含まれています。
media r/LocalLLaMA · 48日前 · 13 回表示 audio.cpp 0.3がSupertonic 3、MOSS-TTS、IndexTTS2、Irodori-TTSをGGUFサポート付きで追加 audio.cppプロジェクトはバージョン0.3をリリースし、5つの新しいテキスト音声変換モデル(Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2、Irodori-TTS)を導入しました。このアップデートではGGUFサポートも追加され、モデルごとに順次展開されます。
media r/LocalLLaMA · 52日前 · 10 回表示 Qwen3-ASRとKokoro-TTSのONNX版がCPU上で動作し、GPU不要の音声アシスタントを実現 あるユーザーは、音声アシスタントのパイプラインにおいてGPUからオフロードできる処理負荷を把握するため、CPU上でONNXモデルとして動作するQwen3-ASRとKokoro-TTSのレイテンシをテストした。
media r/LocalLLaMA · 53日前 · 20 回表示 audio.cppにストリーミングサポートとNemotron 3.5 ASRが追加 audio.cppプロジェクトは、音声認識および合成のための初期ストリーミングサポートと、4つの新しいASR/STTモデル(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR、Hviske ASR)を含むネイティブC++/GGMLフレームワークを更新しました。
media r/LocalLLaMA · 55日前 · 15 回表示 開発者がオンデバイスQwen3 TTS推論用のAndroidアプリを構築 ある開発者は、モバイルデバイス上でQwen3TTS 0.6Bモデルをローカルで実行するAndroidアプリケーションを作成しました。このアプリは、クラウドへの依存なしにテキストから音声への変換処理を可能にするために、カスタムGGMLベースのC++バックエンドを利用しています。