Искусственный интеллект

Kog делает ставку на ускорение AI-инференса через оптимизацию GPU

Французский стартап Kog утверждает, что обычные датацентровые GPU могут дать значительно больше производительности для инференса, если глубже оптимизировать программный слой

Один основной источник · Как мы проверяем новости

Kog делает ставку на ускорение AI-инференса через оптимизацию GPU
Иллюстрация к материалу RedBTC News

Что произошло

Kog продвигает подход к ускорению AI-инференса, при котором основная ставка делается не на специализированные чипы, а на более глубокую программную оптимизацию обычных GPU.

Стартап ранее вышел на главную страницу Hacker News с техпревью, призванным показать, что очень быстрое декодирование одного запроса возможно на стандартных датацентровых GPU, которые уже есть у предприятий. В демонстрации использовались AMD MI300X и NVIDIA H200.

Детали

По словам гендиректора Gaël Delalleau, интерес к технологии вышел за рамки наблюдения: Kog получила 200 конкретных бизнес-лидов. Компания связывает спрос с тем, что скорость и стоимость инференса стали критическим узким местом.

На основе ранней обратной связи Delalleau ожидает, что первым применением станет разработка программного обеспечения. В материале TechCrunch отмечается, что опытные пользователи Claude Code иногда ждут результатов часами, а Anthropic берет повышенную плату за Claude Fast Mode.

Kog также работает с дизайн-партнерами, которые позволяют пользователям генерировать игры и приложения по промпту. Для таких партнеров ускорение через Kog Inference Engine может означать рост выручки, сказал Delalleau.

Почему это важно

Kog пытается занять позицию на рынке, где спрос на быстрый инференс растет, но клиенты, по наблюдениям компании, пока не готовы дообучать небольшие модели. Поэтому после запуска стартап сосредоточился на ускорении более крупных моделей.

Заявленная цель Kog — 30-кратное ускорение инференса LLM. При этом TechCrunch указывает, что путь к этой цели остается значительным: демонстрация показала 3 000 токенов в секунду на запрос, но использовала специально созданную небольшую модель Laneformer 2B примерно с 2 млрд параметров.

Контекст

Delalleau считает ошибочным представление о том, что GPU плохо подходят для декодирования. По его словам, у новых GPU становится все больше пропускной способности памяти, которую можно раскрыть.

Kog не единственная компания, делающая ставку на программную оптимизацию GPU. Французская ZML выпустила аппаратно-независимое ПО, которое обходит Nvidia CUDA для поддержки быстрого инференса на конкурирующих чипах. Delalleau при этом сравнивает Kog скорее с лабораторией Hazy Research в Stanford University, подчеркивая более глубокий фокус на ускорении GPU.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com