Inference efficiency
arxiv arXiv cs.AI · 4 jam lalu · 9 tayangan

CliffCompaction mengurangi biaya agen pemrograman sebesar 50% sambil mempertahankan kinerja

Para peneliti memperkenalkan CliffCompaction, sebuah teknik autocompaction yang dirancang untuk mengurangi biaya bagi agen pemrograman jangka panjang hingga 50% dalam konteks terbatas. Metode ini mempertahankan atau meningkatkan kinerja pada Terminal-Bench dan mencapai hasil terbaik di KernelBench dengan menjaga informasi yang dikompresi tetap setia melalui pemotongan alih-alih parafrase.

arxiv arXiv cs.LG · 5 jam lalu · 9 tayangan

CliffCompaction mengurangi biaya agen pemrograman jangka panjang hingga 50% sambil mempertahankan kinerja

Para peneliti memperkenalkan CliffCompaction, teknik autokompresi yang dirancang untuk agen yang menangani jutaan token, yang memangkas biaya hingga 50% dalam konteks terbatas. Metode ini mempertahankan atau meningkatkan kinerja pada Terminal-Bench dan mencapai hasil terbaik di KernelBench dengan menjaga informasi tetap setia melalui pemotongan alih-alih parafrase.

lab OpenAI News · 11 jam lalu · 16 tayangan

Mengurangi waktu dan biaya penelitian menjadi setengah dengan GPT-6 Astra

Parallel telah mengintegrasikan GPT-6 Astra dari OpenAI ke dalam infrastruktur agen AI-nya, mencapai pengurangan 50% baik dalam waktu penelitian maupun biaya kode dibandingkan dengan model sebelumnya. Perusahaan melaporkan bahwa model baru memungkinkan agen menyelesaikan pekerjaan pengetahuan kompleks secara signifikan lebih cepat sambil mempertahankan output berkualitas tinggi.

github llama.cpp · 17 jam lalu · 9 tayangan

llama.cpp menambahkan dukungan DFlash untuk HunyuanOCR dan memperbaiki konversi draf

Proyek llama.cpp telah menambahkan dukungan untuk dekode spekulatif DFlash dengan model HunyuanOCR dengan mengekspos tensor input lapisan dalam grafik target. Perubahan ini memungkinkan model draf membaca aliran residual, sehingga permintaan gambar dapat berjalan sukses dengan tingkat penerimaan draf sekitar 0,5 dan output OCR yang identik secara byte dibandingkan dengan eksekusi non-spekulatif.

media Hugging Face Forums · 1 hari lalu · 11 tayangan

Pengguna mencari alur kerja untuk abliterasi Llama-Krikri-8B-Instruct guna penggunaan bahasa Yunani secara lokal

Seorang pengguna berencana membangun model bahasa besar (LLM) asli bahasa Yunani tanpa sensor untuk penyebaran lokal menggunakan checkpoint ilsp/Llama-Krikri-8B-Instruct. Rencana yang diusulkan melibatkan abliterasi model dengan Heretic (heretic-llm), konversi ke format GGUF Q4_K_M, dan menjalankan inferensi pada perangkat GMKtec EVO-X3 yang dilengkapi prosesor AMD Ryzen AI MAX+ 395 melalui Vulkan.

media Together AI Blog · 1 hari lalu · 11 tayangan

Together AI memperkenalkan Canary rollouts untuk meningkatkan model di produksi tanpa downtime

Together AI telah memperkenalkan Canary rollouts, sebuah fitur yang memigrasikan lalu lintas langsung dari model saat ini ke checkpoint baru dalam langkah-langkah bertahap. Sistem ini mengotomatisasi mekanisme keamanan untuk pergantian model dengan menjalankan pemeriksaan kesehatan dan gerbang metrik opsional sebelum mengalihkan lalu lintas, memungkinkan jeda dan pembalikan otomatis jika kinerja menurun.

arxiv arXiv cs.AI · 1 hari lalu · 9 tayangan

AgentRouter mengurangi biaya alur kerja agen sebesar 72% melalui penataan model per langkah

Para peneliti mengusulkan AgentRouter, sebuah klasifikator ringan yang mengoptimalkan alur kerja agen multi-langkah dengan menata langkah-langkah lintasan individu ke tingkat model yang sesuai, bukan menggunakan model terdepan untuk setiap tugas. Sistem ini mengatasi inefisiensi solusi yang ada yang mengabaikan kompleksitas sub-tugas yang bervariasi dalam satu sesi agen.

arxiv arXiv cs.CL · 1 hari lalu · 11 tayangan

AgentRouter mengurangi biaya alur kerja agentic sebesar 72% melalui penataan model per langkah

Para peneliti mengusulkan AgentRouter, sebuah klasifikator ringan yang mengoptimalkan alur kerja agentic multi-langkah dengan menata langkah-langkah lintasan individu ke tingkat model yang sesuai, bukan menggunakan satu model terdepan untuk semua tugas. Sistem ini mengatasi inefisiensi sistem perusahaan yang membuang 60-80% dari anggaran inferensi mereka pada sub-tugas yang dapat ditangani sama baiknya oleh model yang lebih kecil.