Chinanews
Tech少数派-数字生活Fri, 28 Aug 2026 08:29:37 +0800

Pai Morning Briefing : Z.ai rend open source le modèle multimodal natif GLM-5.3-Flash et plus encore

人工智能大模型智谱多模态

Le 26 août, Z.ai a publié et rendu open source GLM-5.3-Flash (320B-A18B), le premier modèle multimodal natif de la série GLM-5.

Ce modèle adopte une architecture MoE (Mélange d'experts) avec un total de 320 milliards de paramètres, activant environ 18 milliards de paramètres par token. Il prend en charge les entrées textuelles et visuelles, un contexte d'un million de tokens, et ses poids sont ouverts sous licence MIT. Lors de l'évaluation Artificial Analysis Intelligence Index v4.

1.1, GLM-5.3-Flash a obtenu un score de 57, à égalité avec Claude Opus 4.

8 Max Effort. Les tests internes Z.ai Code Bench v1.

0 montrent que le modèle a obtenu un score de 29,0 au niveau de raisonnement le plus élevé, contre 29,5 pour Claude Opus 4.8. Sur le plan de l'architecture, GLM-5.

3-Flash combine une attention clairsemée et une attention linéaire, et introduit les connexions hyper-restreintes par variété (Manifold-Constrained Hyper-Connections, ou mHC) pour réduire les coûts de calcul de l'inférence à long contexte et l'occupation du cache KV. Le modèle intègre également des capacités visuelles dans les flux de travail de Coding et d'Agent, pouvant s'associer à Browser Use et Computer Use pour traiter les pages Web, les interfaces utilisateur et les retours d'exécution de code. Outre le développement logiciel, GLM-5.

3-Flash prend en charge des scénarios tels que le travail de bureau, la recherche financière et le traitement de documents professionnels. Il peut s'associer à des outils externes pour effectuer des analyses, de la modélisation, et générer des fichiers aux formats PPTX, PDF, DOCX, XLSX, etc. Actuellement, le modèle est intégré à ZCode, GLM Coding Plan et à l'API officielle, et les poids du modèle sont disponibles sur Hugging Face.

Concernant les prix, Z.ai a indiqué que la tarification standard de l'API pour GLM-5.3-Flash est d'environ un dixième de celle de GLM-5.

3, et d'environ un vingtième pendant la période de remise limitée.

Le 25 août, Perplexity s'est associé à NVIDIA pour lancer Portable Computer, un agent IA en périphérie. Ce produit permet d'exécuter intégralement sur l'appareil les flux de travail principaux de Perplexity Computer, réalisant un traitement purement local pour l'analyse de fichiers, la recherche locale et la planification de tâches. Il ne fait appel aux modèles cloud qu'avec l'autorisation de l'utilisateur et uniquement en cas de besoin.

Concernant l'adaptation matérielle et logicielle, Portable Computer prend en charge dès son lancement le NVIDIA DGX Spark fonctionnant sous Linux, capable d'exécuter directement Qwen 3.8 27B ainsi que le modèle PPLX 27B post-entraîné par Perplexity. Toutes les tâches effectuées localement ne consomment pas de Perplexity Credits.

À l'avenir, il intégrera progressivement NVIDIA Nemotron 3.5 Lightning et sa version affinée et profondément optimisée pour des réponses rapides. Actuellement, Portable Computer est ouvert aux utilisateurs de Perplexity Pro et Max ; la prise en charge des systèmes Windows et des PC équipés de GPU GeForce RTX / RTX PRO sera déployée ultérieurement.

Le 25 août, BenQ a publié la série d'écrans professionnels Creative Pro PV50, comprenant deux modèles : le PV3250U de 32 pouces et le PV2750U de 27 pouces. Les deux écrans offrent une résolution 4K UHD et sont destinés au montage vidéo et à l'étalonnage de post-production. Sur le plan colorimétrique, la série PV50 est calibrée pour les flux de travail Rec.

709 et Gamma 2.4. Elle prend en charge la fonction Dark-Tone Clarity (clarté des tons sombres) pour améliorer le rendu des détails dans les ombres, réduisant la compression des noirs et les décalages de teinte.

La série prend également en charge l'uniformité de la couleur et de la luminosité sur tout l'écran, ainsi que l'étalonnage matériel 16-bit 3D LUT, les données de calibration pouvant être stockées dans l'écran. Pour les flux de travail, les écrans fournissent des outils tels que Shadow Check (vérification des ombres), Marker (marquage du cadre) et Area Zoom (zoom localisé), et sont équipés d'un pare-lumière magnétique et d'un contrôleur Hotkey Puck. Concernant les interfaces, la série PV50 prend en charge Thunderbolt 4, permettant la transmission vidéo et de données via un seul câble, avec une alimentation inverse allant jusqu'à 96W.

Source : Google lance le modèle de transcription vocale Gemini 3.

Le 26 août, Google a lancé le modèle de reconnaissance vocale (ASR) Gemini 3.5 Transcribe. Ce modèle prend en charge la transcription en flux en temps réel et la transcription d'audio préenregistré.

Il peut supprimer automatiquement les tics de langage comme « euh » et « hum », les répétitions et les lapsus, et ajuste les résultats de transcription en fonction des auto-corrections de l'utilisateur, générant ainsi un texte plus adapté à la lecture. Google indique que la latence de transcription de bout en bout de Gemini 3.5 Transcribe est réduite d'environ 70 % par rapport à la génération précédente, Chirp 3.

Dans le test de référence multilingue FLEURS, son taux d'erreur par mot (WER) pour la reconnaissance vocale en flux et hors flux est respectivement de 5,50 % et 5,04 %...