Когда вы работаете с данными через ИИ, подставиться можно двумя способами.
Первый — юридический. Вы отправили в публичный чат выгрузку с ФИО и телефонами клиентов. Ответ получили отличный, но данные уже ушли, и отменить это нельзя.
Второй — репутационный. Вы принесли вывод на продуктовый комитет, а на четвёртом слайде выяснилось, что он противоречит дашборду, который все смотрят по понедельникам. В следующий раз вас будут слушать иначе.
Эта статья — про второй способ: как выглядит правдоподобный неправильный ответ и что с ним делать до того, как вы кому-то его показали.
Меня зовут Ева Панкратова, я руководитель продуктовой аналитики в «Метр Квадратный» и ментор курса «Аналитик данных» в Симулейтив.
Разбор: что не так с выводом
Вот вывод, который вполне мог прийти от ИИ или от коллеги:
«Конверсия в подписание выросла на 34% после запуска нового онбординга. Рекомендуем масштабировать онбординг на все каналы».
Прочитайте его ещё раз и попробуйте найти хотя бы пять проблем. На самом деле здесь шесть.
1. Нет знаменателя
34% — это, может быть, рост с 50 сделок до 67? Проценты без абсолютных чисел ничего не значат. Всегда должно быть видно, сколько строк было и сколько осталось после фильтров.
2. Проценты или процентные пункты?
Рост с 10% до 13,4% и с 10% до 44% на бумаге выглядит одинаково — «рост на 34%». Но в первом случае это относительный рост на 34%, а во втором — на 34 процентных пункта. Разница между этими двумя новостями — примерно вся.
3. Нет периода и базы сравнения
Конверсия выросла относительно недели до запуска или относительно того же месяца год назад? Без периода утверждение нельзя проверить.
4. «После» не значит «вследствие»
Одновременно с онбордингом мог измениться состав трафика. Совпадение по времени само по себе не доказывает, что рост дал именно онбординг.
5. Не учтён обычный разброс
Если конверсия и так гуляет неделя к неделе на 40%, рост на 34% от этого колебания не отличить.
6. Рекомендация шире вывода
Данные были по одному каналу, а рекомендация — сразу про все каналы.
Этот вывод не придуман специально плохим. Ровно так выглядят наши собственные выводы, когда мы торопимся.
Пять проверок, которые ловят такие ошибки
Главное правило: выберите проверки до того, как увидите результат. После проверки вы уже влюбились в ответ и будете искать ему оправдания, а не дыры.
- Знаменатель. Доля от чего? Сколько строк было и сколько осталось после фильтров? Проценты — только рядом с абсолютными числами.
- Сходимость. Части складываются в целое, доли дают 100%, сумма по сегментам равна итогу. Расхождение на десятые — обычно округление. Расхождение на проценты — обычно строки, потерянные при объединении таблиц.
- Внешняя сверка. Возьмите одно число, которое вы уже знаете из дашборда или прошлого отчёта, и убедитесь, что анализ его воспроизводит. Не сошлось — останавливаемся и разбираемся, дальше не идём.
- Устойчивость. Меняется ли вывод, если сдвинуть период, убрать крупнейшего клиента или посмотреть по каналам отдельно?
- Наивное объяснение. Сезонность? Сменился состав выборки? Поменялось определение метрики? Большинство «инсайтов» умирает здесь.
Почему внешнюю сверку не отдать ИИ
Это единственная проверка, которую ИИ не может сделать за вас. Он не сходит в ваш дашборд и не вспомнит, что в июле поменяли логику метрики. А когда модель проверяет свой ответ, она рассуждает тем же способом, которым его получила, и независимой проверки не выходит.
Как должен выглядеть корректный вывод
В хорошем выводе семь элементов. Их можно просто попросить у ИИ и требовать каждый раз.
| Элемент | Что в нём должно быть |
|---|---|
| Ответ | Одна фраза, без разгона |
| Число | Со знаменателем, периодом и фильтрами: «184 из 1 240 сделок (14,8%) за июнь–август, без ипотечных» |
| Источник | Таблица или файл, дата выгрузки |
| Как посчитано | Логика в двух строках плюс сам запрос или формула |
| Допущения | Что принято на веру, что отброшено и сколько это в процентах |
| Точность | Насколько точна оценка: диапазон или доверительный интервал |
| Что бы это опровергло | Какой факт или источник заставил бы отказаться от вывода |
Про точность. Если наблюдаемая разница меньше обычного колебания, это не разница. Одна цифра без диапазона всегда врёт о своей точности.
Доверительный интервал и разброс — не одно и то же. Интервал говорит, насколько точна ваша оценка, а разброс — насколько скачут сами данные.
Про опровержение. Последний пункт — страховка на комитете. Человек, который сам назвал слабое место своего анализа, выглядит сильнее того, у кого это слабое место нашли другие.
Зачем всё это
Анализ, который нельзя опровергнуть и не с чем сверить, ничем не отличается от уверенного мнения. Аналитик отличается от генератора текста тем, что знает, где его вывод сломается.
Модель тут ни при чём: у работы с ней просто не было процесса проверки.
ИИ не ошибается реже вас. Он ошибается убедительнее.
