OpenAI представила Deployment Simulation, способ тестирования моделей перед выпуском. Инженеры берут реальные диалоги из продакшена, удаляют ответы предыдущей модели и заменяют их на генерацию от кандидата. Это позволяет оценить поведение системы в реалистичных условиях без участия живых пользователей.
Метод помогает решить проблему осведомленности модели о тестировании. В отличие от синтетических бенчмарков, где нейросети часто понимают, что их проверяют, симуляция на основе реальных логов выглядит для модели как обычный рабочий процесс. Это снижает вероятность искажения ответов.
Технология помогла обнаружить редкие ошибки, включая calculator hacking. OpenAI отмечает, что метод не заменяет ред-тиминг, но дополняет его количественными данными о частоте нежелательного поведения.

