Chinanews
Tech少数派-数字生活Fri, 28 Aug 2026 08:29:37 +0800

Paibao: Z.ai rende open-source il modello multimodale nativo GLM-5.3-Flash e altre notizie

人工智能大模型智谱多模态

Il 26 agosto, Z.ai ha rilasciato e reso open-source GLM-5.3-Flash (320B-A18B), il primo modello multimodale nativo della serie GLM-5.

Il modello adotta un'architettura MoE (Mixture of Experts) con un totale di 320 miliardi di parametri, attivandone circa 18 miliardi per ogni token. Supporta input di testo e immagini con un contesto fino a 1 milione di token e i pesi del modello sono disponibili con licenza MIT. Nella valutazione Artificial Analysis Intelligence Index v4.

1.1, GLM-5.3-Flash ha ottenuto un punteggio di 57, pareggiando con Claude Opus 4.

8 Max Effort. I test interni Z.ai Code Bench v1.

0 mostrano che il modello ha raggiunto 29.0 nella massima modalità di inferenza, contro il 29.5 di Claude Opus 4.

8. A livello architetturale, GLM-5.3-Flash combina attenzione sparsa e attenzione lineare, introducendo le Manifold-Constrained Hyper-Connections (mHC) per ridurre i costi computazionali dell'inferenza a contesto lungo e l'occupazione della KV Cache.

Le capacità visive sono integrate nei flussi di lavoro Coding e Agent, potendo gestire pagine web, interfacce utente e feedback di esecuzione del codice tramite Browser Use e Computer Use. Oltre allo sviluppo software, supporta scenari come ufficio, ricerca finanziaria ed elaborazione di documenti professionali, generando file in formati PPTX, PDF, DOCX e XLSX. Attualmente è integrato in ZCode, GLM Coding Plan e nell'API ufficiale, con pesi disponibili su Hugging Face.

Per i prezzi, l'API standard costa circa un decimo rispetto a GLM-5.3, scendendo a un ventesimo durante lo sconto promozionale.

Perplexity AI lancia Portable Computer Il 25 agosto, Perplexity ha presentato con NVIDIA Portable Computer, un agente AI locale. Il prodotto esegue localmente i flussi di lavoro principali di Perplexity Computer, gestendo analisi file, ricerca locale e pianificazione attività interamente on-device, ricorrendo ai modelli cloud solo con autorizzazione. Hardware e modelli supportano NVIDIA DGX Spark con Linux, eseguendo Qwen 3.8 27B e il modello PPLX 27B post-allenato da Perplexity, senza consumare Perplexity Credits. In futuro verranno integrati NVIDIA Nemotron 3.5 Lightning e versioni ottimizzate. Disponibile per utenti Pro e Max; il supporto per Windows e PC con GPU GeForce RTX / RTX PRO arriverà in seguito. Fonte

BenQ lancia i monitor professionali Creative Pro PV50 Il 25 agosto, BenQ ha presentato la serie Creative Pro PV50, includendo i modelli da 32 pollici PV3250U e 27 pollici PV2750U. Entrambi con risoluzione 4K UHD, sono destinati al montaggio video e al color grading. La serie PV50 è calibrata per i flussi Rec.709 e Gamma 2.4, supporta Dark-Tone Clarity per migliorare i dettagli in ombra, riducendo il black crush e lo shift di tonalità. Offre uniformità di colore e luminosità a schermo intero, calibrazione hardware 16-bit 3D LUT con dati salvati internamente. Gli strumenti includono Shadow Check, Marker e Area Zoom, con hood magnetico e controller Hotkey Puck. L'interfaccia supporta Thunderbolt 4 per video, dati e ricarica fino a 96W. Fonte

Google lancia il modello ASR Gemini 3.5 Transcribe Il 26 agosto, Google ha introdotto Gemini 3.5 Transcribe, un modello di riconoscimento vocale (ASR). Supporta trascrizione in streaming e da audio pre-registrato, rimuovendo esitazioni, ripetizioni ed errori, adattandosi alle autocorrezioni dell'utente per generare testi più leggibili. Google afferma che la latenza end-to-end è ridotta del 70% rispetto a Chirp 3. Nel benchmark multilingue FLEURS, il Word Error Rate (WER) per streaming e non streaming è rispettivamente del 5,50% e del 5,04%.