Implementasi CUDA telah diperbarui untuk memprioritaskan strategi penjadwalan tile penuh untuk FlashAttention. Perubahan ini bertujuan untuk mengoptimalkan alur eksekusi mekanisme perhatian dalam kerangka kerja.
CUDA lebih memilih penjadwalan tile penuh untuk FlashAttention
Eqx-zoo menyediakan port Equinox terverifikasi dari model-model Hugging Face
Penulis telah membangun eqx-zoo, sebuah library yang memuat checkpoint Hugging Face Hub langsung sebagai modul plain Equinox dan memverifikasi setiap model terhadap library transformers. Proyek ini saat ini mendukung Llama, Qwen2, Qwen3, Qwen3-MoE untuk generasi, dan BERT, RoBERTa, XLM-RoBERTa untuk embedding.
Rilis llama.cpp b11401 memperbaiki logging dan mengaktifkan warna ANSI di Windows
Rilis llama.cpp b11401 mengatasi masalah logging dalam mode router server dan menambahkan dukungan untuk warna ANSI pada konsol Windows. Pembaruan ini memastikan bahwa log proses anak dipisahkan dengan benar dari perintah status dan output berwarna ditampilkan dengan tepat di terminal Windows.
Aleph Alpha merilis Kolibri, model MoE bahasa Inggris-Jerman 78.1B dengan 3.46B parameter aktif
Aleph Alpha telah merilis Kolibri-1, sebuah model bahasa Mixture-of-Experts bobot terbuka yang dirancang untuk tugas bilingual bahasa Inggris dan Jerman. Model ini memiliki 78.1 miliar parameter total tetapi hanya mengaktifkan 3.46 miliar per token, memungkinkannya berjalan pada satu GPU B200, B300, atau H200.
llama.cpp b11390 memperbaiki kesalahan memori CUDA MMQ
Proyek llama.cpp telah merilis versi b11390, yang mencakup perbaikan untuk kesalahan memori CUDA MMQ yang terjadi ketika jumlah ahli secara signifikan lebih besar dari ukuran mikro-batch.
llama.cpp b11382 menambahkan dukungan f16 ke WebGPU fill/set_rows
Proyek llama.cpp telah merilis build b11382, yang mencakup pembaruan kunci untuk backend WebGPU-nya. Rilis ini menambahkan dukungan floating-point 16-bit (f16) secara khusus untuk operasi `fill` dan `set_rows` di dalam implementasi WebGPU.