Kabar Pagi Pai: Zhipu Merilis Model Multimodal Open-Source GLM-5.3-Flash, dan Lainnya
Pada 26 Agustus, Zhipu (Z.ai) merilis dan membuka kode sumber (open-source) GLM-5.3-Flash (320B-A18B), model multimodal asli pertama dari seri GLM-5.
Model ini menggunakan arsitektur MoE (Mixture of Experts), dengan total parameter 320 miliar dan mengaktifkan sekitar 18 miliar parameter per Token. Model ini mendukung input teks dan gambar serta konteks 1 juta Token, dengan bobot model yang dibuka di bawah lisensi MIT. Dalam evaluasi Artificial Analysis Intelligence Index v4.
1.1, GLM-5.3-Flash meraih skor 57, sama dengan Claude Opus 4.
8 Max Effort. Pengujian Z.ai Code Bench v1.
0 buatan Zhipu menunjukkan model ini mencetak skor 29.0 pada tingkat inferensi tertinggi, sedangkan Claude Opus 4.8 mencetak 29.
5. Dari segi arsitektur, GLM-5.3-Flash menggabungkan perhatian jarang (sparse attention) dan perhatian linear, serta memperkenalkan Manifold-Constrained Hyper-Connections (mHC) untuk mengurangi biaya komputasi inferensi konteks panjang dan penggunaan KV Cache.
Model ini juga mengintegrasikan kemampuan visual ke dalam alur kerja Coding dan Agent, dapat menggabungkan Browser Use dan Computer Use untuk memproses halaman web, antarmuka pengguna, dan umpan balik eksekusi kode. Selain pengembangan perangkat lunak, GLM-5.3-Flash juga mendukung skenario seperti perkantoran, riset keuangan, dan pemrosesan dokumen profesional.
Model ini dapat menggabungkan alat eksternal untuk menyelesaikan analisis dan pemodelan, serta menghasilkan file dalam format PPTX, PDF, DOCX, dan XLSX. Saat ini, model ini telah terintegrasi dengan ZCode, GLM Coding Plan, dan API resmi, dan bobot model juga telah dibuka di Hugging Face. Untuk harga, Zhipu menyatakan bahwa harga API reguler GLM-5.
3-Flash adalah sekitar sepersepuluh dari GLM-5.3, dan selama periode diskon terbatas sekitar seperdua puluh. Sumber Perplexity AI Meluncurkan Portable Computer Pada 25 Agustus, Perplexity bekerja sama dengan NVIDIA meluncurkan agen AI sisi perangkat (edge AI agent) bernama Portable Computer.
Produk ini mendukung jalannya alur kerja inti Perplexity Computer sepenuhnya di perangkat, mewujudkan pemrosesan lokal murni untuk operasi seperti analisis file, pengambilan data lokal, dan penjadwalan tugas. Produk ini hanya memanggil model cloud secara kolaboratif sesuai kebutuhan setelah mendapatkan otorisasi pengguna. Dalam hal adaptasi perangkat keras dan model, Portable Computer pertama kali mendukung NVIDIA DGX Spark yang menjalankan sistem Linux, dapat langsung menjalankan model Qwen 3.
8 27B dan PPLX 27B hasil pelatihan pasca buatan Perplexity, dan semua tugas yang diselesaikan secara lokal tidak mengonsumsi Perplexity Credits. Ke depannya, akan secara bertahap memperkenalkan NVIDIA Nemotron 3.5 Lightning dan versi fine-tune yang dioptimalkan secara mendalam untuk respons cepat.
Saat ini, Portable Computer telah dibuka untuk pengguna Perplexity Pro dan Max; dukungan untuk sistem Windows serta PC yang dilengkapi GPU GeForce RTX / RTX PRO akan diluncurkan secara bertahap selanjutnya. Sumber BenQ Meluncurkan Monitor Profesional Seri Creative Pro PV50 Pada 25 Agustus, BenQ merilis monitor profesional seri Creative Pro PV50, termasuk dua model yaitu PV3250U 32 inci dan PV2750U 27 inci. Kedua monitor menggunakan resolusi 4K UHD, ditujukan untuk pekerjaan seperti pengeditan video dan color grading pasca-produksi.
Dari segi warna, seri PV50 dikalibrasi untuk alur kerja Rec.709 dan Gamma 2.4, mendukung fungsi Dark-Tone Clarity untuk meningkatkan detail bayangan, mengurangi kompresi black level dan pergeseran rona.
Seri ini juga mendukung keseragaman warna dan kecerahan layar penuh, serta kalibrasi perangkat keras 16-bit 3D LUT, di mana data kalibrasi warna dapat disimpan di dalam monitor. Dalam hal fungsi alur kerja, monitor menyediakan alat seperti Shadow Check, Marker, dan Area Zoom, serta dilengkapi dengan hood magnetik dan pengontrol Hotkey Puck. Untuk antarmuka, seri PV50 mendukung Thunderbolt 4, dapat mentransmisikan video dan data melalui satu kabel, dan menyediakan daya balik (reverse power) hingga 96W.
Sumber Google Meluncurkan Model Speech-to-Text Gemini 3.5 Transcribe Pada 26 Agustus, Google merilis model speech-to-text (ASR) Gemini 3.5 Transcribe.
Model ini mendukung transkripsi streaming real-time dan transkripsi audio rekaman, dapat menghapus kata pengisi seperti "um" dan "uh", konten berulang, dan kesalahan ucapan secara otomatis, serta menyesuaikan hasil transkripsi berdasarkan koreksi diri pengguna selanjutnya untuk menghasilkan teks yang lebih mudah dibaca. Google menyatakan bahwa latensi transkripsi end-to-end Gemini 3.5 Transcribe berkurang sekitar 70% dibandingkan generasi sebelumnya, Chirp 3.
Dalam tolok ukur multibahasa FLEURS, Word Error Rate (WER) pengenalan suara streaming dan non-streaming masing-masing adalah 5,50% dan 5,04% ...





