Sumber · MarkTechPost
media MarkTechPost · 23 jam lalu GDPval-AA (Elo) · 1525.0Elo · 3 tayangan

Google merilis Gemini 3.7 Flash dengan peningkatan algoritmik dan harga lebih rendah

Google telah merilis Gemini 3.7 Flash, sebuah penyempurnaan dari model 3.6 Flash yang menampilkan peningkatan algoritmik pada fondasi penalaran intinya alih-alih pelatihan ulang pra-baru. Model ini mendukung teks, gambar, audio, dan video dalam jendela konteks 1M-token serta menawarkan konfigurasi berpikir yang dapat disesuaikan untuk menyeimbangkan kualitas terhadap biaya dan latensi.

media MarkTechPost · 11 jam lalu · 2 tayangan

Z.ai merilis GLM-5.3 dengan peningkatan kemampuan coding dan keamanan siber melalui pasca-pelatihan

Z.ai telah merilis GLM-5.3, sebuah pembaruan untuk modelnya yang memiliki 743B parameter, yang mencapai peningkatan kinerja melalui skala pasca-pelatihan alih-alih pelatihan ulang model dasar. Rilis ini saat ini tersedia melalui API Z.ai, Paket Coding GLM, dan ZCode, dengan bobot publik dijadwalkan dirilis sekitar dua minggu setelah peluncuran setelah evaluasi keamanan.

media MarkTechPost · 4 hari lalu · 5 tayangan

webAI merilis TwIL-LM, keluarga model logika formal berukuran 1,7B dan 3B untuk autoformalisasi lokal

webAI telah merilis TwIL-LM, sebuah keluarga dua model penalar logika formal dengan parameter 1,7B dan 3B yang dirancang untuk autoformalisasi pada perangkat keras lokal. Model-model ini menerjemahkan bahasa Inggris ke dalam logika orde pertama dan memeriksa validitas kesimpulan, dengan varian 3B mencapai skor gerbang makro sebesar 0,4218 pada tugas logika formal dalam domain.

media MarkTechPost · 5 hari lalu · 3 tayangan

ByteDance Seed memperkenalkan SeedRealtime, LLM full-duplex audio-visual asli

Tim Seed dari ByteDance telah memperkenalkan SeedRealtime, model bahasa besar (LLM) full-duplex audio-visual asli yang menyatukan audio, video, dan teks dalam satu arsitektur terpadu. Berbeda dengan tumpukan bertingkat tradisional dari modul ASR, VLM, dan TTS, SeedRealtime menjalankan persepsi, pemahaman, pengambilan keputusan, dan ekspresi secara paralel untuk memungkinkan interaksi real-time melalui aliran multimodal yang berkelanjutan.

media MarkTechPost · 5 hari lalu · 13 tayangan

NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech full-duplex terbuka dengan pergantian giliran ~450 ms

NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.

media MarkTechPost · 6 hari lalu Berkeley Function-Calling Leaderboard · 70.94% · 16 tayangan

Pokee AI merilis Pokee-Isaac 28B, model konteks 10M-token untuk deployment dalam batas yang ditentukan

Pokee AI telah merilis Pokee-Isaac 28B, model dasar hanya teks dengan 28B parameter yang memiliki jendela konteks 10M-token dan dirancang untuk beroperasi sepenuhnya di dalam batas yang dikontrol oleh pelanggan. Model ini tersedia melalui API yang kompatibel dengan OpenAI dan dilisensikan untuk deployment di VPC, lingkungan on-premises, atau perangkat keras on-device, bukan sebagai open-weight.