Искусственный интеллект

DeepSeek V4.1 Flash достигла 98% результата GPT-6 Astra в дизайне при цене примерно в 70 раз ниже

В тесте OpenDesign Arena модель DeepSeek V4.1 Flash отстала от GPT-6 Astra всего на 1,5 балла, но стоила $0,023 против $1,61 за готовый дизайн

Один основной источник · Как мы проверяем новости

DeepSeek V4.1 Flash достигла 98% результата GPT-6 Astra в дизайне при цене примерно в 70 раз ниже
Иллюстрация к материалу RedBTC News

Что произошло

Компания OpenDesign, создавшая площадку OpenDesign Arena, протестировала 13 ИИ-моделей на одинаковом наборе задач по дизайну. Первое место заняла GPT-6 Astra от OpenAI, однако DeepSeek V4.1 Flash отстала всего на 1,5 балла.

GPT-6 Astra получила в среднем 82,7 балла и справлялась с одной задачей за 11,1 минуты при стоимости $1,61. DeepSeek V4.1 Flash набрала 81,2 балла, завершала работу за 5,3 минуты и обходилась в $0,023.

Как проходила оценка

OpenDesign Arena оценивает повседневные задачи веб-дизайна: создание веб-приложений, дашбордов, мобильных экранов и лендингов. Максимальная оценка составляет 100 баллов: 30 баллов связаны с выполнением требований задания, а 70 — с качеством композиции, иерархии, цвета и соответствием стилю.

Следом за DeepSeek V4.1 Flash расположилась Claude Fable 5.1 с результатом 80,3 балла. На ее работу уходило 12,8 минуты, а стоимость составляла $3,66.

Остальные протестированные модели, включая Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash и Gemini 3.8 Flash, набрали меньше баллов и стоили дороже, чем DeepSeek V4.1 Flash.

Почему это важно

По техническому отчету DeepSeek, экономичность V4.1 Flash объясняется тем, что при общем числе в 552 млрд параметров модель активирует только 8 млрд для чтения входного запроса и 16 млрд для подготовки ответа. DeepSeek называет этот подход архитектурой Causal Encoder-Decoder.

Результат относится именно к задачам повседневного дизайна, где важны скорость и стоимость готового результата.

Ограничения теста и дальнейшие планы DeepSeek

Тест OpenDesign не предназначен для оценки общего уровня рассуждений или навыков программирования. Результат учитывался только в том случае, если модель с первого раза создавала работающую веб-страницу. Пустые, сломанные или обрезанные страницы получали нулевую оценку и повторно не проверялись.

Ранее модель DeepSeek V4 Pro показала результат в пределах 5% от Claude Fable 5 в другом сравнительном тесте при существенно более низкой стоимости. Кроме того, DeepSeek нанимала инженеров в Пекине для создания собственного Code Harness, чтобы контролировать полный агентный стек.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. decrypt.co