Google DeepMind объявила о пилоте первых в индустрии двойных слепых оценок для проприетарной frontier-модели ИИ. Идея в том, чтобы проверять модель на закрытых бенчмарках в криптографически защищённой среде, где сами тесты не могут утечь и использоваться для будущей подгонки результатов.
Что произошло
27 августа Google DeepMind сообщила, что запускает пилот double-blind evaluation для модели класса Gemini Flash Lite. Проект делается вместе с Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Ключевая цель — уменьшить риск benchmark contamination, когда модель заранее «знает» тестовые задания или косвенно обучается на них. В таком случае высокие баллы уже не означают, что система действительно стала лучше: часть результата может быть следствием утечки данных или оптимизации под известный набор проверок.
В пилоте внешние оценки проходят внутри приватной и криптографически защищённой инфраструктуры. По сути, DeepMind хочет поместить процедуру тестирования в технический «контейнер», где доступ к самим заданиям и результатам строго ограничен. Это должно повысить доверие к независимым проверкам, особенно когда речь идёт о мощных коммерческих моделях.
Почему это важно
Рынок ИИ давно упёрся в проблему доверия к бенчмаркам. Чем сильнее становятся модели, тем больше стимулов случайно или намеренно переиспользовать тестовые данные. Из-за этого сравнения между моделями начинают размываться: цифры растут, а уверенность в том, что они отражают реальную способность системы, падает.
Подход DeepMind важен сразу по нескольким причинам:
- Это не очередной релиз модели, а апдейт инфраструктуры доверия. Если проверка устроена плохо, то и любые красивые результаты моделей становятся спорными.
- Речь идёт о внешней валидации, а не только о внутренних тестах компании. Для рынка это гораздо полезнее, потому что снижает зависимость от self-reporting со стороны вендора.
- Используется криптографическая защита среды, то есть DeepMind делает ставку не только на договорённости и zero-logging, но и на технические ограничения.
- Это может стать новым отраслевым стандартом для проверок frontier-систем, особенно в темах безопасности, надёжности и регуляторной отчётности.
Если такой формат приживётся, выиграют не только исследователи и регуляторы, но и корпоративные заказчики. Им всё сложнее принимать решения о внедрении ИИ, когда публичные метрики можно поставить под сомнение.
Что дальше
Пока это именно пилот, а не массовый стандарт. Главный вопрос теперь в том, смогут ли подобные double-blind-проверки стать регулярной практикой для крупных лабораторий, а не единичным экспериментом.
Если DeepMind и её партнёры покажут, что схема работает на практике, дальше логично ждать трёх вещей:
- расширения числа моделей и типов тестов, которые проходят через такие защищённые оценки;
- подключения других лабораторий и независимых организаций;
- постепенного давления на рынок, чтобы заявления о «лучшем качестве» и «лидерстве в бенчмарках» подтверждались более жёсткими процедурами проверки.
Для индустрии это, возможно, менее громкая новость, чем запуск новой модели. Но в долгую она может оказаться не менее важной: без надёжных оценок рынок ИИ всё хуже понимает, что именно на самом деле умеют современные системы.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно