Chinanews
Tech少数派-数字生活Fri, 28 Aug 2026 08:29:37 +0800

Paibao: Z.ai lanza GLM-5.3-Flash, modelo multimodal nativo de código abierto, y más

人工智能大模型智谱多模态

El 26 de agosto, Z.ai publicó y liberó como código abierto GLM-5.3-Flash (320B-A18B), el primer modelo multimodal nativo de la serie GLM-5.

Este modelo adopta una arquitectura MoE (Mezcla de Expertos), con un total de 320 mil millones de parámetros, activando aproximadamente 18 mil millones de parámetros por token. Soporta entrada de texto e imagen, un contexto de 1 millón de tokens y abre los pesos del modelo bajo la licencia MIT. En la evaluación de Artificial Analysis Intelligence Index v4.

1.1, GLM-5.3-Flash obtuvo 57 puntos, empatando con Claude Opus 4.

8 Max Effort. La prueba Z.ai Code Bench v1.

0, desarrollada por Z.ai, muestra que el modelo alcanzó 29.0 puntos en el nivel máximo de inferencia, mientras que Claude Opus 4.

8 obtuvo 29.5. En cuanto a su arquitectura, GLM-5.

3-Flash combina atención dispersa y atención lineal, e introduce conexiones hiperbólicas con restricción de variedad (Manifold-Constrained Hyper-Connections, o mHC), para reducir la sobrecarga computacional y la ocupación de la caché KV en el razonamiento de contexto largo. El modelo también integra capacidades visuales en los flujos de trabajo de Coding y Agent, permitiendo procesar páginas web, interfaces de usuario y retroalimentación de ejecución de código en combinación con Browser Use y Computer Use. Además del desarrollo de software, GLM-5.

3-Flash es apto para entornos de oficina, investigación financiera y procesamiento de documentos profesionales, pudiendo completar análisis y modelado con herramientas externas, y generando archivos en formatos como PPTX, PDF, DOCX y XLSX. Actualmente, el modelo está integrado en ZCode, GLM Coding Plan y la API oficial, y los pesos del modelo están disponibles en Hugging Face. En cuanto a precios, Z.

ai indicó que la tarifa estándar de la API de GLM-5.3-Flash es aproximadamente una décima parte de la de GLM-5.3, y durante el descuento por tiempo limitado, ronda la veinteava parte.

Perplexity AI presenta Portable Computer El 25 de agosto, Perplexity, junto con NVIDIA, lanzó Portable Computer, un agente de IA periférica. Este producto permite ejecutar localmente el flujo de trabajo central de Perplexity Computer, logrando un procesamiento totalmente local para análisis de archivos, recuperación local y programación de tareas, y recurriendo a modelos en la nube bajo demanda solo con la autorización del usuario. En cuanto a la adaptación de hardware y modelos, Portable Computer es compatible desde su lanzamiento con NVIDIA DGX Spark, que ejecuta Linux, permitiendo correr directamente Qwen 3.8 27B y el modelo PPLX 27B de entrenamiento posterior desarrollado por Perplexity. Además, las tareas completadas localmente no consumen Perplexity Credits. En el futuro, se incorporarán progresivamente NVIDIA Nemotron 3.5 Lightning y su versión ajustada optimizada para respuestas rápidas. Actualmente, Portable Computer está disponible para usuarios de Perplexity Pro y Max; el soporte para sistemas Windows y PC equipadas con GPU GeForce RTX / RTX PRO se lanzará posteriormente. Fuente

BenQ lanza la serie de monitores profesionales Creative Pro PV50 El 25 de agosto, BenQ presentó la serie de monitores profesionales Creative Pro PV50, que incluye los modelos de 32 pulgadas PV3250U y de 27 pulgadas PV2750U. Ambos monitores cuentan con resolución 4K UHD y están orientados a la edición de vídeo y la corrección de color en posproducción. En cuanto al color, la serie PV50 está calibrada para flujos de trabajo Rec.709 y Gamma 2.4, y es compatible con la función Dark-Tone Clarity (Claridad de Tonos Oscuros) para mejorar los detalles en las sombras, reduciendo la compresión del negro y la desviación de tono. La serie también ofrece uniformidad de color y brillo en toda la pantalla, así como calibración de hardware 3D LUT de 16 bits, guardando los datos de calibración dentro del monitor. En funciones de flujo de trabajo, los monitores proporcionan herramientas como Shadow Check (Comprobación de Sombras), Marker (Marcador de Formato) y Area Zoom (Zoom de Área), e incluyen una visera magnética y un controlador Hotkey Puck. En interfaces, la serie PV50 es compatible con Thunderbolt 4, permitiendo transmitir vídeo y datos a través de un solo cable y suministrando energía inversa de hasta 96W. Fuente

Google lanza Gemini 3.5 Transcribe, modelo de voz a texto El 26 de agosto, Google presentó Gemini 3.5 Transcribe, un modelo de reconocimiento automático de voz (ASR). Este modelo admite transcripción en streaming en tiempo real y de audio pregrabado, eliminando automáticamente muletillas como «umm» y «eh», contenido repetido y errores, ajustando los resultados según las autocorrecciones del usuario para generar un texto más legible. Google señaló que la latencia de transcripción de extremo a extremo de Gemini 3.5 Transcribe se redujo aproximadamente un 70% en comparación con la generación anterior, Chirp 3. En la prueba de referencia multilingüe FLEURS, su tasa de error de palabra (WER) para el reconocimiento de voz en streaming y no streaming fue del 5,50% y del 5,04%, respectivamente.