Искусственный интеллект

Vals хочет сделать оценку ИИ более независимой и надежной

Стартап Vals, поддержанный Andreessen Horowitz, разрабатывает закрытые тесты для оценки ИИ-моделей на сложных задачах в праве, финансах и программировании

Один основной источник · Как мы проверяем новости

Vals хочет сделать оценку ИИ более независимой и надежной
Иллюстрация к материалу RedBTC News

Что произошло

Стартап Vals, поддержанный Andreessen Horowitz, намерен создать более нейтральную и надежную систему оценки возможностей ИИ-моделей. Компания считает, что традиционные тесты устарели и не всегда отражают реальные способности современных систем.

Vals была основана в 2024 году. В прошлом году компания привлекла посевные инвестиции под руководством 8VC и Bloomberg Beta, а в прошлом месяце получила $40 млн в раунде серии A, который возглавила Andreessen Horowitz.

Как работает подход Vals

Многие системы оценки используют публичные тесты. Это позволяет разработчикам заранее обучать модели на тех же заданиях и оптимизировать результаты. Vals не раскрывает конкретные материалы своих проверок.

Вместо оценки преимущественно общих знаний компания проверяет способность моделей выполнять сложные задачи, связанные с отдельными отраслями, включая право, финансы и программирование.

По замыслу Vals, оценка должна показывать, способны ли модели создавать результат сопоставимого с человеческим качества в разных областях. Компания также хочет учитывать не только положительные, но и потенциально негативные последствия применения ИИ.

Почему это важно

Оценочные тесты стали отраслевым стандартом, с помощью которого компании подтверждают возможности своих моделей и сравнивают их с конкурентами. Высокие результаты при этом могут использоваться как инструмент продвижения.

Сооснователь Vals Rayan Krishnan считает, что академические тесты не успевают за быстрым появлением новых моделей. По его мнению, оценки должны проверять, выполняют ли системы именно те задачи, о которых заявляют их разработчики.

Контекст

Rayan Krishnan — 25-летний сооснователь Vals. Ранее он проходил стажировку в Palantir, а во время учебы в Stanford работал в Microsoft и лаборатории искусственного интеллекта университета.

По словам Krishnan, прежние подходы часто оценивали интеллект моделей слишком абстрактно — например, через проверку знаний, необходимых для теста, похожего на экзамен для получения юридической лицензии. Vals стремится сместить фокус на практические результаты и возможные риски.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com