Сначала имитация, потом реализация: Wizard of Oz для AI-продуктов
Как проверить AI-функцию до готовности модели? Wizard of Oz — ручная имитация бэкенда — позволяет дёшево и быстро протестировать гипотезы. В статье — фреймворк для таких тестов в маленькой команде.
Два года назад я работал над AI-помощником для письма: пользователь вводит абзац, нажимает кнопку и получает расширенную версию. Звучало полезно. Команда разработки оценила, что рабочая модель генерации потребует минимум два месяца. А если пользователям она не нужна, два месяца — впустую.
Это классическая дилемма AI-продукт-менеджера: модели требуют времени, а гипотезы хочется проверить до начала разработки. Моё решение — прототип, который выглядел как работающий AI, но за кулисами был человек.
Wizard of Oz (по имени персонажа из сказки) означает ручную имитацию бэкенда, пока пользователь считает, что всё автоматизировано. В софте так проверяют реакции на ещё не существующие функции.
Зачем не дождаться модели?
Пользователям часто нужен не идеальный AI, а правдоподобный. Основная гипотеза функции расширения: «пользователи хотят быстро расширить текст». Но она распадается на более мелкие: действительно ли это нужно? Какой тон и длина? Сколько они готовы ждать? Что бы они сказали, если бы писал человек?
Ответы можно получить до обучения модели. Wizard of Oz проверяет самый рискованный вопрос: будут ли люди вообще этим пользоваться? Производительность модели можно улучшить позже, но неверное направление — нулевая ценность.
Как мы это делали
Я сделал интерактивный прототип в Figma. При нажатии кнопки появлялся спиннер на несколько секунд, затем показывался заранее написанный текст. Я подготовил шаблоны для нескольких сценариев, но оставил возможность писать на ходу. Испытуемые не знали, что за кулисами человек.
Мы набрали 8 целевых пользователей и дали им задачи: написать письмо, отчёт, описание продукта. Мы наблюдали, пользуются ли они кнопкой расширения и как реагируют на результат. Кто-то редактировал, кто-то копировал, кто-то морщился и возвращался к ручному вводу.
Главным были не клики, а их комментарии: «Этот тон не подходит», «Слишком официально», «Длиннее, чем я бы написал». Они вскрыли расхождение с нашими предположениями.
Простой фреймворк
Если вы хотите провести Wizard of Oz тест, вот четыре шага:
1. Выделите ключевое поведение для имитации. Не имитируйте всю модель — только взаимодействие, которое проверяете: кнопка, задержка, результат. Остальное пусть будет грубым.
2. Ограничьте область имитации. Подготовьте ответы для 3–5 типичных сценариев. На неожиданные запросы отвечайте «функция временно недоступна» или импровизируйте (и записывайте).
3. Контролируйте качество и задержку. Задержка должна быть постоянной (2–3 секунды). Качество — среднее: слишком плохое отпугнёт, слишком хорошее даст ложную уверенность. Важна последовательность: два похожих запроса не должны получать совершенно разные ответы.
4. Определите метрики наблюдения. Кроме выполнения задания, смотрите на мотивацию использовать функцию, эмоциональную реакцию, готовность рекомендовать. Записывайте сессии и проводите короткие опросы после.
Типичные ловушки
- Разнобой имитаторов: разные люди дают разное качество. Закрепите одного имитатора и проведите репетицию.
- Искажение лабораторной среды: пользователи могут быть терпеливее в тесте. Добавьте realistic pressure или ограничение по времени.
- Боязнь раскрыть обман: сообщите участникам после теста. Можно заранее подписать согласие, описывающее тест без раскрытия имитации.
- Остановка на результатах теста: Wizard of Oz показывает, нравится ли функция, но не говорит, как строить модель. Используйте инсайты для установки базовых требований к модели.
Когда не стоит использовать
Избегайте, если гипотеза зависит от задержки (например, результаты за миллисекунды) или требует живых данных (персонализация). Также, если написанный человеком ответ невозможно воспроизвести моделью, тест теряет смысл — вы подтвердите функцию, которую модель не сможет реализовать.
Результат
Тест заставил нас отказаться от кнопки однократного расширения. Вместо этого мы добавили авто-предложение короткого перефразирования при выделении текста с опцией полной версии. Подтверждённым поведением было «пользователи готовы редактировать с подсказки», а не «как хорошо модель пишет». Мы подтвердили это с помощью ручной имитации, не потратив два месяца разработки.
Wizard of Oz — не обман, а честное исследование. Вы притворяетесь, что AI работает, чтобы узнать, должен ли он работать.
PaxLee