Market for Profits

Рынки. Решения. Результаты.

EN
Технологии · Статьи

Почему тот же детектор может давать менее полезные сигналы

Две совокупности при неизменных показателях обнаружения дают разную долю истинных сигналов: результат зависит от состава событий и выбранного знаменателя.

Разбор событий: 2025
Мобильный телефон со значком звонка
Мобильные звонки

8 июля 2025 года «Интерфакс» (Interfax) сообщил, что среди обсуждаемых в России мер фигурировал сервис на основе искусственного интеллекта для выявления подозрительных звонков и предупреждения пользователей. Это описание предлагаемого сервиса, а не опубликованное измерение его точности.

Сигнал ставит иной вопрос, чем тот, на который отвечает доля обнаруженных событий. Детектор может находить значительную часть искомых случаев, но при этом выдавать множество сигналов об обычных событиях. Оба утверждения могут быть правильными одновременно. Чтобы понять причину, нужно знать не только то, как система обрабатывает каждую категорию, но и насколько распространена искомая категория во всём рассматриваемом потоке. Без этого показателю обнаружения легко приписать смысл, которого он не имеет: вероятность того, что уже полученный сигнал обязательно соответствует настоящему случаю.

Следующий пример выделяет именно эту связь. Он не оценивает предлагаемый сервис, не описывает реальный телефонный трафик и не предлагает игнорировать какие-либо предупреждения. Слово «полезный» здесь имеет узкое значение: доля сигналов, которые относятся к заранее заданной целевой категории. Это не полная оценка коммерческой или защитной ценности системы. Для более широкого вывода имели бы значение последствия событий, стоимость реакции и пропущенные случаи, но денежных или иных оценок таких последствий в примере нет. Поэтому арифметический результат не превращается в рекомендацию о действиях конкретного пользователя.

Начнём с событий, категории которых уже заданы

Представим два отдельных набора по 10 000 событий. Назовём их совокупностью А и совокупностью Б. Каждое событие относится либо к целевой категории, либо к обычной. Для расчёта истинная категория каждого события заранее определена и не меняется. Детектор либо выдаёт сигнал, либо не выдаёт его. Сигнал является результатом работы детектора, а не определением истинной категории. Разделение этих двух обозначений позволяет говорить как о правильных, так и об ошибочных результатах. Если заранее считать целевым всё, что вызвало сигнал, проверить ошибки такого рода было бы невозможно.

В совокупности А есть 100 целевых и 9 900 обычных событий. Доля целевой категории, следовательно, составляет один процент. Зададим правило: детектор подаёт сигнал для 90 процентов целевых событий и для одного процента обычных. В построенном примере это точные пропорции. Они не получены при испытании реального продукта и не обещают, что случайный будущий набор обязательно воспроизведёт те же целые количества без отклонений. Мы специально выбираем согласованные числа, чтобы можно было полностью проследить происхождение каждого показателя, не смешивая состав совокупности со статистическим разбросом результатов.

Первое правило даёт 90 сигналов среди 100 целевых событий и оставляет 10 целевых событий без сигнала. Второе даёт 99 сигналов среди 9 900 обычных событий и оставляет 9 801 обычное событие непомеченным. Для описания нужны все четыре группы. Если показать только 90 успешных обнаружений, исчезнут обычные события, тоже попавшие в набор сигналов. Если показать только 99 ложных сигналов, исчезнет значительно большая обычная совокупность, из которой они появились. Отдельное число может быть верным, но без остальных групп читатель не увидит его места в общем расчёте.

Знаменатель меняет смысл процента

Детектор находит 90 из 100 целевых событий: доля обнаружения, также называемая чувствительностью, равна 90 процентам. Он помечает 99 из 9 900 обычных событий: доля ложноположительных результатов равна одному проценту. Однако всего сигналов 189, поскольку объединяются 90 целевых и 99 обычных событий. Только 90 из 189 сигналов относятся к цели, то есть примерно 47,6 процента. Эта последняя доля отвечает на вопрос о составе набора сигналов, а не о каждой исходной категории. Перед нами не три версии одного показателя, а три самостоятельных отношения между группами.

Между чувствительностью 90 процентов и долей истинных случаев среди сигналов около 47,6 процента нет противоречия. Чувствительность начинает с целевых событий и спрашивает, сколько из них помечено. Доля истинных случаев начинает с помеченных событий и спрашивает, сколько из них целевые. Изменилась группа, относительно которой задаётся вопрос. Подмена одного процента другим не упрощает описание, а меняет его предмет. Численная разница возникает потому, что многочисленная обычная категория добавляет ложные сигналы, хотя помечается лишь малая часть этой категории. Большой исходный знаменатель здесь имеет решающее значение.

По той же причине один процент ложноположительных результатов не означает, что ложным является один процент сигналов. В совокупности А ложная доля среди сигналов составляет 99, делённые на 189, или примерно 52,4 процента. Для показателя в один процент знаменателем служат все обычные события. Для показателя 52,4 процента — все сигналы. Обе дроби описывают те же 99 событий, но сравнивают их с разными общими количествами. Процент без названия группы сравнения скрывает именно это различие и создаёт впечатление несовместимости там, где на самом деле изменился вопрос.

Меняем состав, а не показатели детектора внутри категорий

Теперь рассмотрим совокупность Б. В ней 1 000 целевых и 9 000 обычных событий, в сумме по-прежнему 10 000. Целевая доля равна десяти процентам вместо одного. Сохраним оба правила детектора: он помечает 90 процентов целевых событий и один процент обычных. В таком сравнении не меняется порог принятия решения, не появляется новая информация об отдельных событиях и не улучшается способность различать категории. Меняются только относительные размеры категорий. Это ограничение важно: иначе найденную разницу можно было бы объяснить сразу несколькими причинами и потерять выделенный механизм.

Теперь возникает 900 истинных сигналов и 100 пропусков. Обычная категория даёт 90 ложных сигналов и 8 910 непомеченных событий. Общее количество сигналов равно 990. Из них 900 соответствуют целевой категории, поэтому истинная доля составляет примерно 90,9 процента. Детектор всё ещё пропускает десятую часть целевых событий и помечает сотую часть обычных. Гораздо большая часть сигналов оказывается истинной потому, что в исходной совокупности стало намного больше целевых событий относительно обычных. Для этого результата не потребовалось изменять ни одно из двух заданных правил обработки.

Заметим, что количество ложных сигналов немного сократилось: с 99 до 90, хотя общее количество сигналов резко выросло со 189 до 990. Обычная категория стала меньше, и прежний один процент дал меньше ложных срабатываний. Одновременно целевая категория увеличилась в десять раз, дав в десять раз больше истинных сигналов. Это эффект состава совокупности. Он не требует изменения поведения детектора внутри категорий и не доказывает улучшения новой версии программы. Сначала нужно проверить, изменилось ли само соотношение исходных событий, а не объяснять любое движение итоговой доли качеством алгоритма.

Две совокупности также не следует читать как рекомендацию по улучшению настоящей системы. Мы не описали, как отбирать события в эти группы, какие сведения потребовались бы для отбора и сохранились бы при этом показатели внутри категорий. Сравнение намеренно контролируется на бумаге. Оно показывает, что разные доли истинных случаев среди сигналов возможны при одинаковых правилах обнаружения. Чтобы применить такое объяснение к реальному сервису, потребовались бы данные о его совокупности и результатах. Само наличие подходящего арифметического механизма ещё не устанавливает, что именно он действует в конкретном случае.

Общая доля правильных ответов может двигаться в другую сторону

Ещё один привычный показатель считает все правильно классифицированные события, независимо от наличия сигнала. В совокупности А правильны 90 сигналов о целевых событиях и 9 801 отсутствие сигнала об обычных событиях, всего 9 891. Общая доля правильных ответов равна 98,91 процента. В совокупности Б правильны 900 целевых сигналов и 8 910 обычных непомеченных событий, всего 9 810. Общая доля составляет 98,10 процента. По этому показателю А выше, хотя истинная доля среди её сигналов намного ниже. Одно слово «точность» без уточнения формулы поэтому может скрывать существенно разные результаты.

Перестановка объясняется тем, что детектор правильно обрабатывает 99 процентов обычных событий, но лишь 90 процентов целевых. Совокупность А содержит больше событий той категории, для которой заданное правило чаще даёт правильный ответ. В совокупности Б больше событий категории, где правило ошибается чаще. Изменение весов меняет общую долю правильных ответов. Одновременно более многочисленная целевая категория в Б повышает истинную долю внутри набора сигналов. Обе перемены следуют из одних исходных предпосылок и не требуют предполагать, что программа одновременно стала лучше и хуже в одном и том же смысле.

Поэтому назвать результат одной совокупности лучшим без указания показателя было бы недостаточно. У А выше доля правильных ответов среди всех событий. У Б выше доля целевых событий среди сигналов. Чувствительность и доля ложноположительных результатов одинаковы. Ни одно утверждение само по себе не определяет предпочтительную схему работы, поскольку пример не задаёт стоимость пропуска, лишнего сигнала или последующей реакции. Разные показатели вправе по-разному упорядочивать одни построенные результаты. Выбор подходящего показателя зависит от вопроса, который действительно требуется решить, а не только от размера опубликованного процента.

Краткая запись эффекта состава

Обозначим через p долю всех событий, принадлежащих целевой категории. В примере истинные сигналы занимают долю 0,9p всей совокупности. Ложные сигналы занимают 0,01(1 − p), поскольку обычные события образуют оставшуюся часть. Разделив истинные сигналы на все сигналы, получим выражение 0,9p / [0,9p + 0,01(1 − p)]. Это тот же подсчёт, только без привязки к общему количеству 10 000. В числителе остаётся одна группа, а в знаменателе складываются две группы, которые способны вызвать сигнал по заданным правилам.

Подстановка p = 0,01 воспроизводит примерно 47,6 процента для совокупности А. Подстановка p = 0,10 воспроизводит примерно 90,9 процента для Б. Формула также показывает, почему знания чувствительности и доли ложноположительных результатов недостаточно: значение p всё равно нужно задать. Если сообщение приводит два показателя внутри категорий, но не раскрывает состав совокупности, оно не предоставляет всех исходных данных для вычисления истинной доли среди сигналов. Недостающую величину нельзя восстановить, просто записав остальные две с большим количеством знаков после запятой. Точность записи не заменяет отсутствующий параметр.

Для дополнительной арифметической проверки найдём состав, при котором половина сигналов относится к цели. Количества истинных и ложных сигналов тогда равны: 0,9p = 0,01(1 − p). Отсюда p = 1/91, или приблизительно 1,099 процента. Это граница для состава совокупности при заданных правилах. Она не является настройкой детектора, рекомендуемым порогом работы или допустимым уровнем вреда. Число одна вторая не приобретает практического авторитета лишь потому, что его легко узнавать. Мы проверяем свойство формулы, а не устанавливаем норму для реального сервиса или пользователя.

Российский триколор на флагштоке
Российский триколор

Количество сигналов не подтверждает само себя

Предположим, панель показывает только 189 сигналов. Без заданных истинных категорий это количество не раскрывает, что 90 сигналов истинные, а 99 ложные. Существует множество других разбиений с той же суммой 189. Число подтверждает объём результатов, но не служит независимым доказательством их правильности. В нашем примере разбиение известно потому, что оно задано при построении. Реальной оценке потребовалось бы основание для определения категорий, отдельное от самого наличия отметки детектора. Иначе система одновременно создавала бы результат и объявляла его верным без самостоятельной проверки.

Такое же ограничение относится к событиям без сигнала. Проверка только помеченных событий может описать проверенный набор сигналов, но не устанавливает непосредственно, сколько целевых событий было пропущено за его пределами. Наш расчёт чувствительности использует и 90 обнаруженных, и 10 пропущенных целей в А. Если последняя группа отсутствовала бы в данных, заявление о чувствительности 90 процентов потребовало бы дополнительных наблюдений или предположений. Измерение не может само доказать охват группы, которую оно никак не учло. Это ограничение информации, а не спор о том, какое название дать показателю.

Статья не предписывает план испытаний и не предполагает, что безошибочные реальные категории легко установить. Задержка информации, неразрешённые случаи и изменение определений могли бы осложнить такую работу. Более узкий вывод состоит в следующем: обозначения, полученные только из решения самого детектора, не подтверждают это решение независимо. Если объявить каждый сигнал подтверждённой целью, ложноположительные результаты исчезнут по определению, а не вследствие доказанного отсутствия ошибок. Отличать эти два обстоятельства необходимо ещё до обсуждения того, насколько велик набор данных или насколько сложен применённый алгоритм.

Сохраняем одну единицу наблюдения

Совокупности состоят из событий, а не обязательно из разных людей, устройств или организаций. Несколько событий могут относиться к одному участнику. Десять помеченных звонков сами по себе не означают десять разных звонящих или десять разных получателей. В арифметике количество событий последовательно используется от исходной совокупности до набора сигналов. Переход к количеству людей посередине изменил бы знаменатель и нарушил сверку, даже если каждое событие записано правильно. Поэтому единица наблюдения должна оставаться явной во всех строках, а не появляться лишь в заголовке первой таблицы.

Категории также должны относиться к тому же периоду и той же совокупности, что и оцениваемые сигналы. Целевую долю одной группы нельзя автоматически использовать для объяснения сигналов другой. Контролируемый пример специально меняет эту долю и получает иной результат. Следовательно, границы совокупности являются частью смысла показателя, а не просто справочной информацией. Для переноса процента за пределы исходной группы нужно основание считать, что существенные исходные условия сохраняются. Одинаковое название детектора не доказывает одинакового состава событий, которые попадают на его вход.

Повторяющиеся события также предостерегают от восприятия приведённых процентов как гарантии для произвольных наборов. Конструкция задаёт точные количества, чтобы напрямую показать смену знаменателей. Она не предполагает независимых случайных событий и не оценивает разброс выборочных результатов. Это были бы дополнительные решения о модели. Реальная наблюдаемая доля могла бы отличаться из-за случайных колебаний, другой зависимости между событиями или иных показателей обработки внутри категорий. Однако для доказательства показанного эффекта состава ни одну из этих возможностей вводить не требуется. Достаточно уже заданных четырёх групп в каждой совокупности.

Больше сигналов и больше работы — разные измерения

Совокупность Б даёт 990 сигналов вместо 189 в А, хотя большая доля сигналов Б соответствует цели. Это количество могло бы иметь значение для предполагаемой проверки, но не определяет потребность в персонале. Пример не задаёт времени обработки, правил автоматизации и требования одинаково проверять каждый сигнал. Умножение количества сигналов на придуманную универсальную трудоёмкость создало бы отдельную операционную модель, а не завершило существующий расчёт. Чтобы перейти от событий к рабочему времени, нужны новые предпосылки; они не содержатся автоматически ни в чувствительности, ни в истинной доле сигналов.

Более высокая истинная доля также не означает исчезновения пропусков. В совокупности Б пропущено 100 целевых событий, а в А — 10, поскольку целевая категория Б больше. Доля пропусков в обоих случаях остаётся равной десяти процентам. Поэтому сообщение может правдиво описывать одновременно более высокую истинную долю среди сигналов и большее абсолютное количество пропущенных целей. Сравнение только одного из этих утверждений скроет другое, а не решит вопрос об общей ценности детектора. Абсолютное количество и доля отвечают на связанные, но всё-таки разные вопросы.

Отделяем изменение состава от изменения поведения

В нашей конструкции показатели детектора внутри категорий не ухудшаются. Если наблюдатель увидел бы снижение истинной доли сигналов при переходе от Б к А, вся перемена объяснялась бы сокращением целевой доли с десяти процентов до одного. Приписывать такое построенное снижение программному дефекту было бы неправильно. Однако в реальной ситуации нельзя без доказательств предполагать ни неизменность показателей, ни изменение состава. Пример даёт одно достаточное объяснение, а не диагноз для любого ухудшения опубликованной метрики. Чтобы выбрать между объяснениями, потребовались бы наблюдения, которых в нашей арифметической конструкции нет.

Различие ограничивает и сравнение поставщиков или подразделений. Две опубликованные доли истинных сигналов могут различаться из-за состава совокупностей, из-за работы детекторов либо по обеим причинам. Здесь выделена первая возможность. Пример не устанавливает универсальной процедуры корректировки и не делает несопоставимые данные сопоставимыми одним заявлением. Содержательное сравнение должно хотя бы определить совокупности, категории и опубликованный показатель, прежде чем объявлять численный разрыв преимуществом качества. Без этих определений сама величина разрыва, даже очень большая, не раскрывает причину различий и не указывает автоматически на лучший продукт.

Точно описываем, что устанавливает сигнал

Две совокупности дают ясный результат: одинаковая чувствительность и одинаковая доля ложноположительных результатов не обеспечивают одинаковой истинной доли среди сигналов. В А рядом с 90 истинными сигналами находятся 99 ложных. В Б рядом с 900 — 90. Разница возникает потому, что исходные совокупности содержат разные доли целевых событий. При этом общая доля правильных ответов ставит А выше Б. Так становится видно, почему неуточнённое утверждение о точности способно скорее скрыть результат, чем объяснить его. Формула показателя нужна не меньше, чем само полученное значение.

Поэтому аккуратное описание разделяет три вопроса: сколько целевых событий обнаружено, сколько обычных событий помечено и сколько сигналов соответствует цели. У каждого свой знаменатель. Указание этих знаменателей и стоящей за ними совокупности не говорит человеку, как реагировать на отдельное предупреждение. Оно делает измерение понятным, не позволяет переименовать одну условную долю в другую и не превращает большое количество сигналов в необоснованное заявление об успехе. Именно эта ясность необходима до обсуждения более широких последствий работы системы, для которых одного подсчёта событий уже недостаточно.

Оставить комментарий