Модели Видео Цены Блог FAQ API Войти

Google DeepMind запустила первые двойные слепые оценки frontier-моделей ИИ

Google DeepMind объявила о пилоте первых в индустрии двойных слепых оценок для проприетарной frontier-модели ИИ. Идея в том, чтобы проверять модель на закрытых бенчмарках в криптографически защищённой среде, где сами тесты не могут утечь и использоваться для будущей подгонки результатов.

Что произошло

27 августа Google DeepMind сообщила, что запускает пилот double-blind evaluation для модели класса Gemini Flash Lite. Проект делается вместе с Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.

Ключевая цель — уменьшить риск benchmark contamination, когда модель заранее «знает» тестовые задания или косвенно обучается на них. В таком случае высокие баллы уже не означают, что система действительно стала лучше: часть результата может быть следствием утечки данных или оптимизации под известный набор проверок.

В пилоте внешние оценки проходят внутри приватной и криптографически защищённой инфраструктуры. По сути, DeepMind хочет поместить процедуру тестирования в технический «контейнер», где доступ к самим заданиям и результатам строго ограничен. Это должно повысить доверие к независимым проверкам, особенно когда речь идёт о мощных коммерческих моделях.

Почему это важно

Рынок ИИ давно упёрся в проблему доверия к бенчмаркам. Чем сильнее становятся модели, тем больше стимулов случайно или намеренно переиспользовать тестовые данные. Из-за этого сравнения между моделями начинают размываться: цифры растут, а уверенность в том, что они отражают реальную способность системы, падает.

Подход DeepMind важен сразу по нескольким причинам:

Если такой формат приживётся, выиграют не только исследователи и регуляторы, но и корпоративные заказчики. Им всё сложнее принимать решения о внедрении ИИ, когда публичные метрики можно поставить под сомнение.

Что дальше

Пока это именно пилот, а не массовый стандарт. Главный вопрос теперь в том, смогут ли подобные double-blind-проверки стать регулярной практикой для крупных лабораторий, а не единичным экспериментом.

Если DeepMind и её партнёры покажут, что схема работает на практике, дальше логично ждать трёх вещей:

Для индустрии это, возможно, менее громкая новость, чем запуск новой модели. Но в долгую она может оказаться не менее важной: без надёжных оценок рынок ИИ всё хуже понимает, что именно на самом деле умеют современные системы.

Нейросети для текста, картинок, видео и музыки

Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.

Начать бесплатно
← Все статьи