Статья / ИИ

Как проверять качество ответов ИИ

Убедительный текст может содержать неверный расчёт или вывод без основания. Разбираем проверку на маркетинговом примере и собираем небольшой набор контрольных заданий.

Лупа и оранжевый карандаш на петле бумажной ленты с синими фрагментами и отметками проверки.

Качество ответа ИИ определяется тем, можно ли использовать его для вашей задачи. У текста могут быть хороший ритм, уверенная интонация и аккуратная таблица — при этом ключевой вывод окажется неверным.

Проверка начинается с того, что должно было получиться: точная сводка, расчёт, рекомендация или черновик для обсуждения. Для них нужны разные критерии. В OpenAI предлагают оценивать модель на задачах, близких к реальному применению, и сочетать измеримые проверки с человеческой оценкой. Рекомендации по оценке качества.

Ниже — схема, которую можно применить к одному ответу без отдельной платформы тестирования.

Разделите ответ на проверяемые части

Сначала отметьте утверждения, от которых зависит действие. Если по отчёту будут менять рекламный бюджет, проверьте определения метрик, расчёты и основание рекомендации. Если перед вами черновик заголовков, важнее соответствие продукту, адресату и допустимым обещаниям.

Что проверяемРабочий вопрос
Соответствие задачеПолучилось ли то, что просили?
ФактыОткуда взялись числа, характеристики и условия?
ВычисленияСовпадают ли формула, данные и результат?
ВыводСледует ли он из приведённых фактов?
Готовность к использованиюПонятно ли, что делать и где есть ограничения?

Не усредняйте всё в одну красивую оценку. Ошибка в ключевой цене не компенсируется хорошим стилем. Заранее выделите условия, нарушение которых останавливает использование результата: выдуманный источник, потерянная оговорка, неверная сумма или действие за пределами задания.

Остальные замечания можно разделить на те, что мешают работе, и редакторские. Это помогает закончить проверку, когда существенные проблемы устранены.

Пример: кликов больше, что с результатом?

Все числа ниже условные. Сравниваются две завершённые когорты за одинаковые по длине периоды; для каждой учтены связанные с ней заявки и оплаты. Доход, маржа и доля новых покупателей неизвестны.

ПоказательПериод АПериод Б
Расходы на рекламу, BYN1 0001 400
Клики5 0007 000
Заявки200210
Оплаченные заказы2018

Представим, что ИИ написал: «Трафик вырос на 40%, стоимость клика стабильна, кампания стала эффективнее. Можно масштабировать».

Первые две части согласуются с таблицей, если под трафиком здесь понимаются клики. Последняя требует проверки. Пересчитаем показатели:

  • Стоимость клика: 0,20 BYN в обоих периодах.
  • Стоимость заявки: 1 000 / 200 = 5 BYN и 1 400 / 210 ≈ 6,67 BYN.
  • Стоимость оплаченного заказа: 1 000 / 20 = 50 BYN и 1 400 / 18 ≈ 77,78 BYN.
  • Доля заявок среди кликов: 4% и 3%.

Видим больше кликов при ухудшении стоимости заявки и оплаченного заказа. Данных о прибыли нет, а причины изменений таблица не объясняет. Вывод о готовности к масштабированию не обоснован.

Назвать 77,78 BYN показателем CAC тоже было бы неточно: неизвестно, сколько заказов сделали новые покупатели. Здесь рассчитана стоимость оплаченного заказа. Такая подмена термина может незаметно испортить следующий расчёт.

Корректный ответ предложил бы проверить состав трафика, обработку обращений и причины потерь между этапами. Для этой части есть разбор воронки продаж. Указывать виноватую кампанию без дополнительных данных пока рано.

Откройте источники, на которых держится вывод

Для каждого важного внешнего факта перейдите по ссылке. Проверьте, существует ли документ, относится ли он к нужному продукту и периоду, подтверждает ли конкретное утверждение. Страница справки о функции не доказывает, что функция доступна в вашем аккаунте.

Внутри компании роль источника может выполнять выгрузка, письмо с согласованными условиями или запись интервью. Здесь проверка такая же: найдите исходный фрагмент и сравните смысл. Слова одного покупателя нельзя превращать в частотность возражения без подсчёта всей выборки.

Если источник прочитан частично, обозначьте границу. Например: проверены итоговые суммы и десять строк с максимальными расходами. Это полезная проверка, но она не подтверждает каждую запись файла.

Отдельно смотрите на причинные слова: «из-за», «привело», «доказало». Иногда данные показывают только совместное изменение показателей. Причину ещё предстоит установить.

Используйте ИИ как второго проверяющего

Модели можно дать ответ и конкретную задачу проверки: найти неподтверждённые утверждения, сопоставить цифры с таблицей, отметить потерянные ограничения. Попросите вернуть спорный фрагмент, основание замечания и предлагаемую правку.

Такой разбор тоже нужно оценить. Исследование LLM-as-a-judge, опубликованное в 2023 году, описывает среди ограничений модельных оценщиков чувствительность к порядку ответов и многословию. Это основание осторожно использовать автоматического судью; исследование не устанавливает качество всех современных моделей. Работа Zheng и соавторов.

При сравнении двух вариантов можно скрыть названия моделей, поменять ответы местами и посмотреть, сохранится ли аргументированное предпочтение. Число «уверенность 95%», которое модель сама написала рядом с вердиктом, не является измеренной точностью на ваших задачах.

Для фактической проверки дайте проверяющему исходник. Два согласных между собой ответа без источника могут повторить одну и ту же ошибку.

Соберите несколько контрольных заданий

Если одна задача повторяется, сохраните небольшой набор примеров с понятной приёмкой. Начать можно с обычного случая и трёх неудобных:

  1. В исходнике отсутствует важное поле: ожидается указание пробела.
  2. Два документа противоречат друг другу: ожидается фиксация расхождения.
  3. Красивый вывод не следует из цифр: ожидается ограничение вывода.

Для каждого задания запишите обязательные факты и недопустимые ошибки. После изменения модели или рабочего промпта повторите эти задания с теми же исходниками. Сохраните фактические результаты, включая неудачные.

Четыре примера помогут заметить отдельную проблему, но не докажут надёжность на всём потоке. По мере работы добавляйте случаи, где ответ пришлось существенно исправлять. OpenAI рекомендует расширять оценочный набор реальными примерами и проверять систему после изменений. Построение оценочного процесса.

Перед автоматизацией процесса определите, какие ошибки остановят выполнение, какие отправят задачу человеку и какие можно исправить автоматически. Возьмите последний полезный ответ ИИ и проверьте его по таблице выше: что в нём уже подтверждено, а чему вы пока поверили на слух?

На что опирается разбор

Ссылки на справки и исследования, использованные в статье. Условия конкретного продукта стоит сверять перед применением.

ОБСУЖДЕНИЕ

Пока тихо. Можно начать.

Загружаю обсуждение…

СЛЕДУЮЩИЙ ШАГ

Что ещё поможет в этой задаче