← 뒤로 media r/LocalLLaMA · 6시간 전 · open_models pipecat-ai, GPT 5.6 Terra 성능을 갖춘 phonellm-alpha-1 출시 번역 English → 한국어 pipecat-ai 프로젝트는 일반적인 음성 에이전트 작업에서 GPT 5.6 과 비교할 만한 성능을 달성하는 phonellm-alpha-1 모델을 출시했습니다. 이 모델은 비교 기준선 대비 삼분의 일의 지연 시간으로 작동합니다.비용은 참조 솔루션의 약 열여덟 분의 일입니다. 중요도 2/3 r/LocalLLaMA Inference efficiency Voice & audio 원문 보기 관련 기사 github llama.cpp · 19일 전 · 조회수 12회 llama.cpp b10369, pocket-tts 지원 추가 및 CUDA 생성 80% 가속 llama.cpp 프로젝트가 빌드 b10369를 출시하여 pocket-tts 텍스트 음성 변환 모델에 대한 지원을 도입했습니다. 이 업데이트에는 성능 최적화를 위해 GEMM과 col2im을 사용한 전치 컨볼루션의 새로운 구현이 포함되어 있습니다. media r/LocalLLaMA · 48일 전 · 조회수 13회 audio.cpp 0.3, GGUF 지원과 함께 Supertonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS 추가 audio.cpp 프로젝트가 버전 0.3을 출시하며 다섯 가지 새로운 텍스트 음성 변환 모델을 도입했습니다: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2, Irodori-TTS. 이번 업데이트에서는 GGUF 지원도 추가되었으며, 모델별로 순차적으로 적용될 예정입니다. media r/LocalLLaMA · 52일 전 · 조회수 10회 CPU에서 실행되는 Qwen3-ASR 및 Kokoro-TTS ONNX, GPU 없는 음성 비서 가능 한 사용자가 음성 비서 파이프라인에서 GPU로 오프로드할 수 있는 처리 부하를 파악하기 위해 CPU에서 ONNX 모델로 실행되는 Qwen3-ASR과 Kokoro-TTS의 지연 시간을 테스트했습니다. media r/LocalLLaMA · 53일 전 · 조회수 20회 audio.cpp에 스트리밍 지원 및 Nemotron 3.5 ASR 추가 audio.cpp 프로젝트는 음성 인식 및 합성을 위한 초기 스트리밍 지원과 함께 네 가지 새로운 ASR/STT 모델(Nemotron 3.5 ASR, Higgs Audio STT, VibeVoice ASR, Hviske ASR)을 포함하는 네이티브 C++/GGML 프레임워크를 업데이트했습니다. media r/LocalLLaMA · 55일 전 · 조회수 15회 개발자가 온디바이스 Qwen3 TTS 추론을 위한 Android 앱 구축 한 개발자가 모바일 기기에서 Qwen3TTS 0.6B 모델을 로컬로 실행하는 Android 애플리케이션을 만들었습니다. 이 앱은 클라우드 의존성 없이 텍스트 음성 변환(TTS) 처리를 가능하게 하기 위해 커스텀 GGML 기반 C++ 백엔드를 활용합니다.
github llama.cpp · 19일 전 · 조회수 12회 llama.cpp b10369, pocket-tts 지원 추가 및 CUDA 생성 80% 가속 llama.cpp 프로젝트가 빌드 b10369를 출시하여 pocket-tts 텍스트 음성 변환 모델에 대한 지원을 도입했습니다. 이 업데이트에는 성능 최적화를 위해 GEMM과 col2im을 사용한 전치 컨볼루션의 새로운 구현이 포함되어 있습니다.
media r/LocalLLaMA · 48일 전 · 조회수 13회 audio.cpp 0.3, GGUF 지원과 함께 Supertonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS 추가 audio.cpp 프로젝트가 버전 0.3을 출시하며 다섯 가지 새로운 텍스트 음성 변환 모델을 도입했습니다: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2, Irodori-TTS. 이번 업데이트에서는 GGUF 지원도 추가되었으며, 모델별로 순차적으로 적용될 예정입니다.
media r/LocalLLaMA · 52일 전 · 조회수 10회 CPU에서 실행되는 Qwen3-ASR 및 Kokoro-TTS ONNX, GPU 없는 음성 비서 가능 한 사용자가 음성 비서 파이프라인에서 GPU로 오프로드할 수 있는 처리 부하를 파악하기 위해 CPU에서 ONNX 모델로 실행되는 Qwen3-ASR과 Kokoro-TTS의 지연 시간을 테스트했습니다.
media r/LocalLLaMA · 53일 전 · 조회수 20회 audio.cpp에 스트리밍 지원 및 Nemotron 3.5 ASR 추가 audio.cpp 프로젝트는 음성 인식 및 합성을 위한 초기 스트리밍 지원과 함께 네 가지 새로운 ASR/STT 모델(Nemotron 3.5 ASR, Higgs Audio STT, VibeVoice ASR, Hviske ASR)을 포함하는 네이티브 C++/GGML 프레임워크를 업데이트했습니다.
media r/LocalLLaMA · 55일 전 · 조회수 15회 개발자가 온디바이스 Qwen3 TTS 추론을 위한 Android 앱 구축 한 개발자가 모바일 기기에서 Qwen3TTS 0.6B 모델을 로컬로 실행하는 Android 애플리케이션을 만들었습니다. 이 앱은 클라우드 의존성 없이 텍스트 음성 변환(TTS) 처리를 가능하게 하기 위해 커스텀 GGML 기반 C++ 백엔드를 활용합니다.