GPT-5.6 meningkatkan efisiensi AI di seluruh model, inferensi, dan alur kerja agentic
GPT-5.6 meningkatkan efisiensi kecerdasan buatan di berbagai dimensi, termasuk arsitektur model, proses inferensi, dan alur kerja agentic.
GPT-5.6 meningkatkan efisiensi kecerdasan buatan di berbagai dimensi, termasuk arsitektur model, proses inferensi, dan alur kerja agentic.
OpenAI menguraikan sebuah kerangka kerja yang disebut "Kecerdasan Berguna per Dolar" untuk membantu bisnis mengukur nilai ekonomi dari investasi AI mereka melampaui metrik biaya-per-token sederhana. Artikel tersebut berargumen bahwa kesuksesan harus diukur berdasarkan pekerjaan yang diselesaikan, keandalan, dan skalabilitas, bukan hanya tingkat adopsi.
OpenAI meluncurkan pratinjau Ultrafast, tingkat layanan baru yang menjalankan model GPT-5.6 Sol hingga 14 kali lebih cepat daripada pemrosesan standar. Didukung oleh perangkat keras Cerebras, mode ini menghasilkan hingga 750 token keluaran per detik dan awalnya tersedia melalui API OpenAI.
OpenAI telah mengurangi biaya model GPT-5.6 Luna dan Terranya sambil memperkenalkan "mode Cepat" baru untuk GPT-5.6 Sol guna meningkatkan kinerja per dolar di seluruh beban kerja perusahaan.
Peneliti dari Nvidia telah memperkenalkan FusionRelight, sebuah metode untuk pencahayaan ulang potret yang menggabungkan transfer iluminasi yang secara fisik masuk akal dengan pelestarian identitas dan inferensi real-time yang ringkas. Pendekatan ini memanfaatkan Fusi Pengetahuan Domain Hibrida (HDKF), sebuah kerangka pelatihan yang mendistilasi prior fisika, reflektansi, dan realisme dari data sintetis, One-Light-at-a-Time (OLAT), dan di alam liar ke dalam model siswa.
Peneliti mengidentifikasi Pergeseran Informasi Visual Relevan (RVIS) selama dekoding sebagai penyebab utama kegagalan metode pemangkasan token visual yang ada pada Model Bahasa Besar Multimodal (MLLM). Untuk mengatasi hal ini, mereka mengusulkan Pemangkasan Token Sadar Pergeseran Tahap Dekoding (DSTP), sebuah kerangka kerja tanpa pelatihan yang menyelaraskan token visual dengan persyaratan penalaran yang berubah.
Para peneliti menyajikan Cluster-Guided Vector Quantization (CGVQ), sebuah metode yang dirancang untuk meningkatkan kinerja laju-distorsi pada kompresi gambar berbasis primitif Gauss. Pendekatan ini mempartisi parameter Gauss menjadi kelompok-kelompok homogen sebelum kuantisasi, mengatasi inefisiensi yang disebabkan oleh penyimpanan sejumlah besar parameter floating-point per primitif.
vLLM telah merilis versi 0.27.1, sebuah pembaruan patch yang dibangun di atas rilis sebelumnya v0.27.0.
Meta merilis Muse Glimmer, model multimodal padat berukuran 30B yang dioptimalkan untuk penyebaran agen lokal di bawah lisensi Apache 2.0, sambil juga menjanjikan bobot masa depan untuk Muse Spark 1.2.
OpenAI telah mengumumkan pengurangan harga yang signifikan untuk model-model GPT-5.6-nya, didorong oleh peningkatan efisiensi sistemik dan teknik optimisasi diri secara rekursif. Perusahaan melaporkan bahwa biaya kecerdasan tingkat GPT-5.4 telah turun sekitar 13 kali lipat dalam empat bulan, dengan harga GPT-5.6 Luna dipotong sebesar 80% dan Terra sebesar 20%.
OpenAI telah secara signifikan menurunkan harga untuk keluarga model GPT-5.6, memperkenalkan penurunan harga besar-besaran sebesar 80% untuk GPT-5.6 Luna dan pengurangan sebesar 20% untuk GPT-5.6 Terra. Perubahan ini dimungkinkan oleh GPT-5.6 Sol, yang mengoptimalkan forward pass dan kernel produksi model untuk meningkatkan efisiensi.
Tencent telah merilis keluarga model terjemahan multibahasa "berpikir cepat" Hy-MT2, termasuk ukuran 1.8B, 7B, dan 30B-A3B (MoE), bersama dengan benchmark IFMTBench untuk mengevaluasi kemampuan mengikuti instruksi.
Proyek llama.cpp telah merilis versi b10435, yang mengatasi masalah kinerja dalam mesin template Jinja. Perubahan utama memperbaiki bug kompleksitas waktu kuadratik dalam fungsi `gather_string_parts`.
Proyek llama.cpp merilis build b10434, yang menambahkan dukungan untuk meneruskan parameter `reasoning_effort` ke template Jinja. Perubahan ini memastikan bahwa nilai `reasoning_effort` dari OpenAI Chat Completions disimpan dan tersedia selama generasi.
Proyek llama.cpp merilis versi b10431, yang memperkenalkan dukungan untuk rollback keadaan rekuren (RS) dalam operasi ggml_ssm_scan. Perubahan ini memungkinkan rollback RS untuk model Nemotron di backend CPU dan CUDA.
Qwen telah merilis bobot terbuka untuk model Qwen 3.8 27B-nya. Checkpoint tersedia di Hugging Face.
Proyek llama.cpp merilis versi b10429, yang memodifikasi server untuk mengizinkan akses ke endpoint /metrics dan /slots saat llama_decode() sedang dieksekusi.
Proyek llama.cpp telah merilis versi b10430, yang memperkenalkan dukungan untuk perangkat GPU terintegrasi (igpu) virtual. Pembaruan ini juga mencakup komentar yang ditingkatkan di dalam basis kode.
Proyek llama.cpp merilis versi b10427, yang mencakup optimasi kinerja untuk GPU Intel Arc melalui SYCL. Pembaruan ini mengimplementasikan penggabungan operasi gate, up, dan GLU di dalam lapisan jaringan feed-forward padat (FFN) q4_K.
Proyek llama.cpp telah merilis versi b10425, yang mencakup port optimasi SYCL untuk menggabungkan salinan penulisan kembali keadaan gated-delta-net.