Chinanews
Tech少数派-数字生活Fri, 28 Aug 2026 08:29:37 +0800

Утренний дайджест Pai: Z.ai открывает исходный код нативной мультимодальной модели GLM-5.3-Flash и другие новости

人工智能大模型智谱多模态

26 августа компания Z.ai выпустила и открыла исходный код GLM-5.3-Flash (320B-A18B) — первой нативной мультимодальной модели из серии GLM-5.

Модель построена на архитектуре MoE (Mixture of Experts), имеет общий объем параметров 320 млрд и активирует около 18 млрд параметров на каждый токен. Она поддерживает ввод текста и изображений, а также контекст до 1 млн токенов, а веса модели открыты под лицензией MIT. В оценке Artificial Analysis Intelligence Index v4.

1.1 модель GLM-5.3-Flash набрала 57 баллов, сравнявшись с Claude Opus 4.

8 Max Effort. Тест Z.ai Code Bench v1.

0, разработанный самой компанией, показал, что на максимальном уровне рассуждения модель набирает 29,0 балла, тогда как Claude Opus 4.8 — 29,5. С точки зрения архитектуры, GLM-5.

3-Flash сочетает разреженное и линейное внимание, а также внедряет Manifold-Constrained Hyper-Connections (mHC) для снижения вычислительных затрат при длинноконтекстном выводе и использования KV-кэша. Модель также интегрирует визуальные возможности в рабочие процессы Coding и Agent, позволяя обрабатывать веб-страницы, пользовательские интерфейсы и обратную связь от выполнения кода в связке с Browser Use и Computer Use. Помимо разработки программного обеспечения, GLM-5.

3-Flash поддерживает сценарии для офисной работы, финансовых исследований и обработки профессиональных документов. Она может использовать внешние инструменты для анализа и моделирования, а также генерировать файлы в форматах PPTX, PDF, DOCX и XLSX. В настоящее время модель интегрирована в ZCode, GLM Coding Plan и официальный API, а ее веса доступны на Hugging Face.

Что касается цен, Z.ai заявляет, что стандартная цена API для GLM-5.3-Flash составляет около одной десятой от цены GLM-5.

3, а в период ограниченной скидки — около одной двадцатой.

Perplexity AI представила Portable Computer 25 августа Perplexity совместно с NVIDIA представила периферийного ИИ-агента Portable Computer. Этот продукт поддерживает полноценное локальное выполнение основного рабочего процесса Perplexity Computer, обеспечивая локальную обработку анализа файлов, поиска и планирования задач. Облачные модели вызываются по мере необходимости только после получения разрешения пользователя. Что касается аппаратной и модельной адаптации, Portable Computer при запуске впервые поддерживает NVIDIA DGX Spark под управлением Linux. На нем можно напрямую запускать Qwen 3.8 27B и модель PPLX 27B, доработанную Perplexity путем постобучения, причем все задачи, выполняемые локально, не расходуют Perplexity Credits. В будущем также будет постепенно внедрена модель NVIDIA Nemotron 3.5 Lightning и ее глубоко оптимизированные версии для быстрого отклика. В настоящее время Portable Computer доступен пользователям Perplexity Pro и Max; поддержка Windows и ПК с графическими процессорами GeForce RTX / RTX PRO будет добавлена позже. Источник

BenQ представила профессиональные мониторы серии Creative Pro PV50 25 августа компания BenQ выпустила профессиональные мониторы серии Creative Pro PV50, включающей две модели: 32-дюймовую PV3250U и 27-дюймовую PV2750U. Оба монитора имеют разрешение 4K UHD и предназначены для видеомонтажа и постпродакшн-колор-коррекции. В плане цветопередачи серия PV50 настроена для рабочих процессов Rec.709 и Gamma 2.4. Она поддерживает функцию Dark-Tone Clarity для улучшения детализации теней, уменьшения компрессии черного и сдвига оттенков. Серия также поддерживает равномерность цвета и яркости по всему экрану, а также аппаратную калибровку 16-bit 3D LUT, при этом данные калибровки могут храниться внутри монитора. Что касается функций рабочего процесса, мониторы предоставляют такие инструменты, как Shadow Check, Marker и Area Zoom, а также оснащаются магнитной блендой и контроллером Hotkey Puck. В плане интерфейсов серия PV50 поддерживает Thunderbolt 4, что позволяет передавать видео и данные по одному кабелю с обеспечением обратного питания мощностью до 96 Вт. Источник

Google представила модель преобразования речи в текст Gemini 3.5 Transcribe 26 августа Google представила модель автоматического распознавания речи (ASR) Gemini 3.5 Transcribe. Модель поддерживает транскрипцию как в режиме реального времени, так и для предварительно записанных аудиофайлов. Она может автоматически удалять слова-паразиты, повторы и оговорки, а также корректировать результат транскрипции на основе последующих исправлений самого пользователя, генерируя текст, более удобный для чтения. По заявлению Google, сквозная задержка транскрипции у Gemini 3.5 Transcribe сократилась примерно на 70% по сравнению с предыдущим поколением Chirp 3. В многоязычном бенчмарке FLEURS коэффициент ошибок в словах (WER) для потокового и непотокового распознавания речи составил 5,50% и 5,04% соответственно.