Chinanews
Tech少数派-数字生活Fri, 28 Aug 2026 08:29:37 +0800

Paipianbao: Z.ai veröffentlicht offenes natives multimodales Modell GLM-5.3-Flash und mehr

人工智能大模型智谱多模态

Am 26. August veröffentlichte und open-source-te Z.ai (Zhipu) das erste native multimodale Modell der GLM-5-Serie, GLM-5.

3-Flash (320B-A18B). Das Modell nutzt eine MoE-Architektur (Mixture of Experts) mit insgesamt 320 Milliarden Parametern, wobei pro Token etwa 18 Milliarden Parameter aktiviert werden. Es unterstützt Text- und Bildeingaben sowie einen Kontext von 1 Million Token und veröffentlicht die Modellgewichte unter der MIT-Lizenz.

Im Artificial Analysis Intelligence Index v4.1.1 erreichte GLM-5.

3-Flash 57 Punkte und liegt damit gleichauf mit Claude Opus 4.8 Max Effort. Der hauseigene Z.

ai Code Bench v1.0-Test zeigt, dass das Modell in der höchsten Inferenzstufe 29,0 Punkte erzielt, während Claude Opus 4.8 auf 29,5 kommt.

Architektonisch kombiniert GLM-5.3-Flash Sparse Attention und Linear Attention und führt Manifold-Constrained Hyper-Connections (mHC) ein, um den Rechenaufwand für Long-Context-Inferenz und den KV-Cache-Verbrauch zu senken. Das Modell integriert visuelle Fähigkeiten zudem in Coding- und Agent-Workflows und kann Browser Use und Computer Use kombinieren, um Webseiten, Benutzeroberflächen und Code-Ausführungs-Feedback zu verarbeiten.

Neben der Softwareentwicklung unterstützt GLM-5.3-Flash auch Szenarien wie Büroanwendungen, Finanzforschung und professionelle Dokumentverarbeitung. Es kann externe Tools für Analysen und Modellierungen nutzen und Dateien in Formaten wie PPTX, PDF, DOCX und XLSX generieren.

Das Modell ist nun in ZCode, GLM Coding Plan und über die offizielle API verfügbar; die Modellgewichte wurden auf Hugging Face veröffentlicht. Was den Preis betrifft, so gab Z.ai an, dass die regulären API-Kosten für GLM-5.

3-Flash bei etwa einem Zehntel derer von GLM-5.3 liegen, während sie in einer zeitlich begrenzten Rabattphase nur etwa ein Zwanzigstel betragen.

Perplexity AI stellt Portable Computer vor Am 25. August präsentierte Perplexity gemeinsam mit NVIDIA den Edge-KI-Agenten Portable Computer. Das Produkt unterstützt das vollständige Ausführen der Kern-Workflows von Perplexity Computer direkt auf dem Gerät. Dies ermöglicht eine rein lokale Verarbeitung von Dateianalysen, lokaler Suche und Aufgabenplanung. Eine Cloud-Modell-Koordination erfolgt nur nach Nutzerautorisierung und bei Bedarf. In Bezug auf Hardware- und Modellkompatibilität unterstützt der Portable Computer ab sofort das mit Linux betriebene NVIDIA DGX Spark. Darauf lassen sich direkt Qwen 3.8 27B sowie das von Perplexity selbst nachtrainierte PPLX 27B-Modell ausführen. Alle lokal ausgeführten Aufgaben verbrauchen keine Perplexity Credits. Künftig sollen zudem NVIDIA Nemotron 3.5 Lightning und eine für schnelle Antworten tiefenoptimierte Feinabstimmungsversion schrittweise eingeführt werden. Der Portable Computer ist derzeit für Perplexity Pro- und Max-Nutzer verfügbar. Die Unterstützung für Windows-Systeme sowie PCs mit GeForce RTX / RTX PRO GPUs wird im weiteren Verlauf nachgereicht. Quelle

BenQ stellt professionelle Monitore der Creative Pro PV50-Serie vor Am 25. August veröffentlichte BenQ die professionellen Monitore der Creative Pro PV50-Serie, darunter die 32-Zoll- und 27-Zoll-Modelle PV3250U und PV2750U. Beide Monitore verfügen über eine 4K UHD-Auflösung und richten sich an Anwendungen wie Videoschnitt und Postproduktions-Farbgrading. Farbleistungstechnisch ist die PV50-Serie für Rec.709- und Gamma 2.4-Workflows kalibriert. Sie unterstützt die Funktion Dark-Tone Clarity zur Verbesserung der Schattendetails, was Black-Crushing und Farbverschiebungen reduziert. Die Serie bietet zudem bildschirmweite Farb- und Helligkeitsgleichmäßigkeit sowie eine 16-Bit 3D LUT-Hardwarekalibrierung, deren Kalibrierungsdaten intern im Monitor gespeichert werden können. Bei den Workflow-Funktionen bieten die Monitore Werkzeuge wie Shadow Check, Marker und Area Zoom und werden mit einer magnetischen Lichtblende sowie einem Hotkey Puck-Controller geliefert. Anschlusstechnisch unterstützt die PV50-Serie Thunderbolt 4, womit Video und Daten über ein einziges Kabel übertragen und bis zu 96W Reverse Charging bereitgestellt werden können. Quelle

Google veröffentlicht das Spracherkennungsmodell Gemini 3.5 Transcribe Am 26. August führte Google das ASR-Modell (Automatic Speech Recognition) Gemini 3.5 Transcribe ein. Das Modell unterstützt Echtzeit-Streaming-Transkription und die Transkription vorab aufgezeichneter Audiodaten. Es kann automatisch Füllwörter wie „Ähm“, Wiederholungen und Versprecher entfernen und das Transkriptionsergebnis an nachfolgende Selbstkorrekturen des Nutzers anpassen, um besser lesbaren Text zu generieren. Laut Google ist die End-to-End-Transkriptionslatenz von Gemini 3.5 Transcribe im Vergleich zum Vorgänger Chirp 3 um etwa 70 % gesunken. Im mehrsprachigen FLEURS-Benchmark liegt die Wortfehlerrate (WER) der Spracherkennung für Streaming bzw. Nicht-Streaming bei 5,50 % und 5,04 %.