Перейти к содержимому

Первым 10 новым аккаунтам — по 100 расчётов бесплатно. Осталось мест:

Зарегистрироваться
ГолПульс

Дистанция и дисперсия: месяц ничего не доказывает

Опубликовано:

Дисперсия в ставках — это про то, что двадцать ставок не отличают хорошую модель от плохой. Если истинная точность прогнозиста 52%, то на выборке в двадцать событий честный 95-процентный интервал — примерно ±22 процентных пункта: результат от 30% до 74% полностью укладывается в случайность. Именно поэтому месячный отчёт телеграм-канала не значит ничего, каким бы красивым он ни был.

Дальше — формула, которой это считается, таблица «сколько ставок сколько стоит» и наши собственные числа в качестве подопытного: бэктест на 21 544 матчах даёт 51,2% угаданных исходов, а живой трек-рекорд на 329 матчах — 49,2% (срез на момент подготовки материала; на витрине трек-рекорда выборка растёт и проценты идут дальше). Разберём, противоречат ли эти два числа друг другу.

Откуда берётся разброс

Серия ставок устроена как серия подбрасываний нечестной монеты: у каждой свой шанс зайти, исходы независимы, результат — количество удач. Такая схема называется биномиальной, и разброс в ней возникает не из-за ошибок прогнозиста, а из самой природы случайности.

Простой мысленный эксперимент. Подбросьте честную монету двадцать раз. Ровно десять орлов выпадет примерно в одном случае из шести; результаты вроде 13:7 или 7:13 — обычное дело. Никто не скажет, что монета сломалась. Ровно то же самое происходит с прогнозами, только там ещё и вероятность каждой попытки своя, а значит, разброс шире.

Из этого следует неприятная вещь. Наблюдая короткую серию, вы видите не качество модели, а сумму качества и шума — и на коротких отрезках шум громче. Отделить одно от другого можно только количеством наблюдений.

Формула, которая считает шум

Ширина шума измеряется стандартной ошибкой доли: корень из p × (1 − p) / n, где p — доля угаданных, n — число ставок. Привычный 95-процентный интервал — это 1,96 такой ошибки в каждую сторону, на практике удобно считать «примерно вдвое».

Посчитаем столбиком для p = 0,52. Стандартная ошибка на ста ставках: 0,52 × 0,48 = 0,2496, делим на 100 — получается 0,002496, корень — 0,050. Умножаем на 1,96 и получаем 9,8 процентного пункта. Тот же расчёт для остальных размеров выборки — везде для одной и той же гипотетической точности 52%, так что последняя строка отвечает на вопрос «а какой был бы интервал, будь у нас 52%», а не описывает наш реальный результат:

СтавокСтандартная ошибкаИнтервал 95%Что это значит
2011,2 п.п.±21,9 п.п.от 30% до 74%
507,1 п.п.±13,8 п.п.от 38% до 66%
1005,0 п.п.±9,8 п.п.от 42% до 62%
3292,8 п.п.±5,4 п.п.от 47% до 57%
10001,6 п.п.±3,1 п.п.от 49% до 55%
21 5440,3 п.п.±0,7 п.п.от 51% до 53%

Читается таблица так. Чтобы отличить прогнозиста с 52% от прогнозиста с 45%, нужны минимум сотни ставок — на сотне их интервалы всё ещё перекрываются. Чтобы говорить о точности с погрешностью в один пункт, нужны десятки тысяч наблюдений: интервал сужается как корень из n, поэтому вчетверо более точная оценка стоит в шестнадцать раз больше матчей.

Полезный ориентир для практики: чтобы измерить свою точность с погрешностью ±2 пункта, нужно около 2400 ставок. Это порядка года ежедневной работы, а не месяц.

Обратите внимание на структуру формулы. Множитель p × (1 − p) максимален при p = 0,5 и падает к краям, поэтому шум сильнее всего мешает там, где события примерно равновероятны, — то есть ровно на исходах футбольных матчей. Ставки на очевидных фаворитов с вероятностью около 0,9 дают куда более гладкую картинку, но именно они и создают рекламные проценты проходимости, ничего не говорящие о прибыли. Красивая стабильная статистика и осмысленная статистика — часто разные вещи.

Наши числа: 51,2% против 49,2%

Теперь применим всё это к себе. Есть два числа, полученные разными способами.

ВыборкаМатчейУгадано исходовИнтервал 95%
Бэктест на истории21 54451,2%от 50,5% до 51,9%
Живой трек-рекорд, с 30 июня 202632949,2%от 43,8% до 54,6%

Живая цифра на два пункта ниже бэктестовой, и соблазн сделать вывод велик: модель на истории выглядит лучше, чем в бою. Считаем: интервал вокруг 49,2% на 329 матчах — от 43,8% до 54,6%, и бэктестовые 51,2% лежат внутри с большим запасом. Никакого противоречия в данных нет, есть выборка, которой пока мало.

Честно назовём и то, чего этот расчёт не доказывает. Он не доказывает, что модель в бою работает так же хорошо, как на истории, — он лишь показывает, что данных не хватает, чтобы утверждать обратное. Разница между «доказано, что нет разницы» и «разницу пока не видно» существенная, и продавцы прогнозов регулярно ею пользуются.

Ловушка разрезов: 45,3% и 52,1%

Дисперсия особенно коварна, когда выборку начинают резать. Вот наш живой трек-рекорд, разделённый по типу турнира:

ТурнирыМатчейПопаданийДоляИнтервал 95%
Клубные лиги1376245,3%от 37,0% до 53,6%
Квалификация еврокубков19210052,1%от 45,0% до 59,2%

Разрыв в 6,8 процентного пункта выглядит как готовый вывод: «модель лучше работает на еврокубковой квалификации». Проверим его арифметикой. Стандартная ошибка разности двух долей — корень из суммы их квадратов ошибок: 0,453 × 0,547 / 137 плюс 0,521 × 0,479 / 192, корень из суммы даёт 0,056. Интервал для разности — ±10,9 пункта, и он спокойно накрывает ноль. Разницы, скорее всего, просто нет.

Отсюда общее правило: каждый новый разрез делит выборку и умножает шум. Прогнозист, который показывает вам точность «по домашним фаворитам в чемпионатах Скандинавии», почти наверняка показывает результат перебора срезов, а не найденную закономерность. Наши разрезы, включая этот, открыты целиком в трек-рекорде — вместе с разрезом, который выглядит невыгодно.

Кстати о срезах внутри среза. Из 329 боевых прогнозов 269 указывали на победу хозяев (135 попаданий, 50,2%) и 60 — на победу гостей (27 попаданий, 45,0%). Прогнозов «ничья» среди них ноль, и это не робость: ничья редко бывает самым вероятным из трёх исходов, о чём подробнее в статье про ставку на ничью.

Что спрашивать у прогнозиста

Из всего сказанного получается короткий чеклист, который работает и против нас.

Первое — размер выборки. Не «за июль», а сколько именно прогнозов и за какой период. Если число двузначное, дальше можно не смотреть: любой результат на такой выборке объясняется случаем.

Второе — полнота истории. Проценты считаются по всем прогнозам, а не по оставшимся после чистки. Единственная защита — фиксация до начала матча и открытый архив; как это проверить, разобрано в статьях о капперах и о проходимости прогнозов.

Третье — определение. Точность исхода 1X2, двойного шанса и «нескольких рынков» — три разных числа, и подменять их друг другом легко и незаметно.

Четвёртое — метрика калибровки. Её наличие отличает того, кто себя измерял, от того, кто себя рекламировал.

Калибровка: метрика, которую дисперсия не смывает

У доли угаданных есть фундаментальный недостаток: она выбрасывает почти всю информацию. Прогноз «60% на хозяев» и прогноз «95% на хозяев» засчитываются одинаково, хотя это принципиально разные заявления.

Калибровка проверяет другое — совпадают ли заявленные вероятности с реальными частотами. Берём все матчи, где модель обещала около 60%, и смотрим, в скольких из них событие случилось. Если примерно в 60% — модель калибрована. Средний разрыв по всем таким группам и называется ошибкой калибровки, ECE.

У нас она 0,007, то есть в среднем по всем группам заявленная вероятность расходится с фактической частотой примерно на 0,7 процентного пункта; до калибровочной поправки было 0,011. Оговорка тут существенная: это среднее по группам, а не гарантия для каждой из них — на отдельной группе расхождение может быть заметно больше. Зато утверждение проверяется на всей выборке сразу, а не на одной ставке, и потому устойчиво к дисперсии куда лучше, чем процент угаданных. Подробный разбор наших метрик — в статье о реальной точности прогнозов.

Границы этой арифметики

Формула стандартной ошибки предполагает независимые попытки с одинаковой вероятностью успеха. У ставок ни то ни другое не выполняется строго: матчи одного тура связаны общими факторами, а вероятность у каждого прогноза своя. Точный интервал в таких условиях считается сложнее, но грубая оценка выше даёт правильный порядок величины, и для практики этого достаточно.

Второе ограничение серьёзнее. Доля угаданных вообще не то, что определяет прибыль: ставки на фаворитов с низкими коэффициентами дают высокий процент и убыток. ROI шумит ещё сильнее процента — там к разбросу исходов добавляется разброс коэффициентов, и выборки нужны не сотни, а тысячи. Поэтому мы не выносим ROI в витрину: на нашей нынешней дистанции его знак ничего не доказывает.

И третье: длинная выборка честна только тогда, когда модель за это время не менялась. Любая правка обнуляет накопленное сравнение — и это ещё одна причина, по которой результаты бэктеста и живого трек-рекорда стоит держать раздельно, а не складывать в одну красивую цифру.

Как это используется в ГолПульс

Мы фиксируем каждый боевой прогноз до начала матча и грейдим после финального свистка, без права редактирования задним числом. Открыты и метрики, и разрезы, и выборка — в трек-рекорде, а методика описана в разделе как это работает. Прогнозы на ближайшие туры лежат в каталоге матчей.

Главная мысль этой статьи неудобна для любого сервиса прогнозов, включая наш: сегодняшним числам стоит верить ровно настолько, насколько велика выборка под ними. Через несколько сотен матчей 49,2% превратятся во что-то другое — и это будет не изменение модели, а сужение интервала. Другие разборы методов — в рубрике «Методы и модель».

Вопросы и ответы

Сколько ставок нужно, чтобы оценить прогнозиста?

Сотни. При истинной точности 52% выборка из 20 ставок даёт 95-процентный интервал около ±22 процентных пунктов, из 100 — ±10, из 1000 — ±3. Месячная статистика на паре десятков ставок не отличает работающую модель от бесполезной в принципе.

Как посчитать доверительный интервал для доли угаданных?

Стандартная ошибка доли — корень из p × (1 − p) / n, а 95-процентный интервал примерно вдвое шире: 1,96 стандартной ошибки в каждую сторону. Для 52% на 100 ставках это корень из 0,52 × 0,48 / 100 = 0,05, то есть ±9,8 процентного пункта.

Почему у одной модели точность на разных выборках разная?

Из-за размера выборки, а не из-за модели. У нас бэктест на 21 544 матчах даёт 51,2%, а живой трек-рекорд на 329 матчах — 49,2%. Интервал вокруг второго числа примерно от 43,8% до 54,6%, и первое лежит внутри: разница целиком объясняется шумом.

Что такое ECE и зачем эта метрика?

Ошибка калибровки: средневзвешенный по группам вероятностей разрыв между заявленным и фактическим. У нас она 0,007 — в среднем по всем группам расхождение около 0,7 процентного пункта, хотя на отдельной группе оно может быть заметно больше. Доля угаданных этого не показывает вовсе.

Может ли плюсовая стратегия долго быть в минусе?

Да, и это норма. На отрезке в несколько десятков ставок дисперсия перекрывает преимущество в несколько процентов с огромным запасом. Отличить неудачную серию от сломанной модели можно только по длинной выборке или по метрикам калибровки.

Источники

Проверьте модель на живых матчах

ГолПульс считает вероятности исходов и счёта для РПЛ и топ-лиг Европы. Регистрация даёт 3 бесплатных расчёта.

Начать бесплатно — 3 расчёта

Сервис носит информационно-аналитический характер и не является букмекером. Прогнозы — вероятностная оценка, а не гарантия результата. 18+

Читайте также