Claude Opus 5 собрал FPS-демо по короткому промпту без внешних ассетов
Разработчик Shumer описал подход Gauntlet Loop: модель разбивает задачу на части, подключает отдельных критиков и дорабатывает результат в цикле
Один основной источник · Как мы проверяем новости

Что произошло
Shumer сообщил, что Claude Opus 5 с первой попытки собрал игровое демо, и добавил, что в билд не попал ни один внешний ассет.
Вместо длинного технического задания использовался промпт из трех коротких абзацев. Он просил Opus 5 создать шутер уровня последних Call of Duty, разделить работу между subagents и пропускать каждую часть через отдельного строгого критика до сравнения с реальными кадрами Call of Duty в слепом сопоставлении.
Как работал подход Gauntlet Loop
Shumer назвал метод Gauntlet Loop. Его идея — дать агенту проверяемую планку, позволить разбить задачу на небольшие части и направлять каждую часть к критику, который не видит рассуждений разработчика.
Разработчик позднее написал, что не указывал рендерер, не перечислял игровые системы и не определял, что именно должно входить в качество уровня AAA.
Какие функции Claude Code использовались
В основе цикла были две возможности Claude Code. Subagents запускаются в изолированных контекстных окнах со своими инструкциями и доступом к инструментам, поэтому критик, оценивающий модель оружия, не наследует объяснения сборщика о его решениях.
Ultracode в Claude Code переводит модель на максимальное усилие рассуждения и позволяет ей писать собственный план оркестрации, распределяя работу до 16 агентов одновременно при лимите 1 000 за один запуск.
Встроенный навык Anthropic /loop поддерживал повторяющиеся циклы исправления, тестирования и корректировки. Shumer не задавал число раундов и закрыл сессию сам после нескольких часов доработок.
Почему это заметно
Описанный опыт идет против привычного совета для prompt engineering: вместо подробных критериев и точного описания качества Shumer оставил определение результата критику, которого Opus 5 построил для себя.
По опубликованному журналу критика, оценка выросла с 3,59 из 10 до уровня немного выше 5, но каждый раунд все еще уступал реальной игре.
Источники
Один основной источник. Как мы проверяем новости


