DeepSeek V4.1 Flash достигла 98% результата GPT-6 Astra в дизайне при цене примерно в 70 раз ниже
В тесте OpenDesign Arena модель DeepSeek V4.1 Flash отстала от GPT-6 Astra всего на 1,5 балла, но стоила $0,023 против $1,61 за готовый дизайн
Один основной источник · Как мы проверяем новости

Что произошло
Компания OpenDesign, создавшая площадку OpenDesign Arena, протестировала 13 ИИ-моделей на одинаковом наборе задач по дизайну. Первое место заняла GPT-6 Astra от OpenAI, однако DeepSeek V4.1 Flash отстала всего на 1,5 балла.
GPT-6 Astra получила в среднем 82,7 балла и справлялась с одной задачей за 11,1 минуты при стоимости $1,61. DeepSeek V4.1 Flash набрала 81,2 балла, завершала работу за 5,3 минуты и обходилась в $0,023.
Как проходила оценка
OpenDesign Arena оценивает повседневные задачи веб-дизайна: создание веб-приложений, дашбордов, мобильных экранов и лендингов. Максимальная оценка составляет 100 баллов: 30 баллов связаны с выполнением требований задания, а 70 — с качеством композиции, иерархии, цвета и соответствием стилю.
Следом за DeepSeek V4.1 Flash расположилась Claude Fable 5.1 с результатом 80,3 балла. На ее работу уходило 12,8 минуты, а стоимость составляла $3,66.
Остальные протестированные модели, включая Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash и Gemini 3.8 Flash, набрали меньше баллов и стоили дороже, чем DeepSeek V4.1 Flash.
Почему это важно
По техническому отчету DeepSeek, экономичность V4.1 Flash объясняется тем, что при общем числе в 552 млрд параметров модель активирует только 8 млрд для чтения входного запроса и 16 млрд для подготовки ответа. DeepSeek называет этот подход архитектурой Causal Encoder-Decoder.
Результат относится именно к задачам повседневного дизайна, где важны скорость и стоимость готового результата.
Ограничения теста и дальнейшие планы DeepSeek
Тест OpenDesign не предназначен для оценки общего уровня рассуждений или навыков программирования. Результат учитывался только в том случае, если модель с первого раза создавала работающую веб-страницу. Пустые, сломанные или обрезанные страницы получали нулевую оценку и повторно не проверялись.
Ранее модель DeepSeek V4 Pro показала результат в пределах 5% от Claude Fable 5 в другом сравнительном тесте при существенно более низкой стоимости. Кроме того, DeepSeek нанимала инженеров в Пекине для создания собственного Code Harness, чтобы контролировать полный агентный стек.
Источники
Один основной источник. Как мы проверяем новости


