Дистанция и дисперсия: месяц ничего не доказывает
Опубликовано:
Дисперсия в ставках — это про то, что двадцать ставок не отличают хорошую модель от плохой. Если истинная точность прогнозиста 52%, то на выборке в двадцать событий честный 95-процентный интервал — примерно ±22 процентных пункта: результат от 30% до 74% полностью укладывается в случайность. Именно поэтому месячный отчёт телеграм-канала не значит ничего, каким бы красивым он ни был.
Дальше — формула, которой это считается, таблица «сколько ставок сколько стоит» и наши собственные числа в качестве подопытного: бэктест на 21 544 матчах даёт 51,2% угаданных исходов, а живой трек-рекорд на 329 матчах — 49,2% (срез на момент подготовки материала; на витрине трек-рекорда выборка растёт и проценты идут дальше). Разберём, противоречат ли эти два числа друг другу.
Откуда берётся разброс
Серия ставок устроена как серия подбрасываний нечестной монеты: у каждой свой шанс зайти, исходы независимы, результат — количество удач. Такая схема называется биномиальной, и разброс в ней возникает не из-за ошибок прогнозиста, а из самой природы случайности.
Простой мысленный эксперимент. Подбросьте честную монету двадцать раз. Ровно десять орлов выпадет примерно в одном случае из шести; результаты вроде 13:7 или 7:13 — обычное дело. Никто не скажет, что монета сломалась. Ровно то же самое происходит с прогнозами, только там ещё и вероятность каждой попытки своя, а значит, разброс шире.
Из этого следует неприятная вещь. Наблюдая короткую серию, вы видите не качество модели, а сумму качества и шума — и на коротких отрезках шум громче. Отделить одно от другого можно только количеством наблюдений.
Формула, которая считает шум
Ширина шума измеряется стандартной ошибкой доли: корень из p × (1 − p) / n, где p — доля угаданных, n — число ставок. Привычный 95-процентный интервал — это 1,96 такой ошибки в каждую сторону, на практике удобно считать «примерно вдвое».
Посчитаем столбиком для p = 0,52. Стандартная ошибка на ста ставках: 0,52 × 0,48 = 0,2496, делим на 100 — получается 0,002496, корень — 0,050. Умножаем на 1,96 и получаем 9,8 процентного пункта. Тот же расчёт для остальных размеров выборки — везде для одной и той же гипотетической точности 52%, так что последняя строка отвечает на вопрос «а какой был бы интервал, будь у нас 52%», а не описывает наш реальный результат:
| Ставок | Стандартная ошибка | Интервал 95% | Что это значит |
|---|---|---|---|
| 20 | 11,2 п.п. | ±21,9 п.п. | от 30% до 74% |
| 50 | 7,1 п.п. | ±13,8 п.п. | от 38% до 66% |
| 100 | 5,0 п.п. | ±9,8 п.п. | от 42% до 62% |
| 329 | 2,8 п.п. | ±5,4 п.п. | от 47% до 57% |
| 1000 | 1,6 п.п. | ±3,1 п.п. | от 49% до 55% |
| 21 544 | 0,3 п.п. | ±0,7 п.п. | от 51% до 53% |
Читается таблица так. Чтобы отличить прогнозиста с 52% от прогнозиста с 45%, нужны минимум сотни ставок — на сотне их интервалы всё ещё перекрываются. Чтобы говорить о точности с погрешностью в один пункт, нужны десятки тысяч наблюдений: интервал сужается как корень из n, поэтому вчетверо более точная оценка стоит в шестнадцать раз больше матчей.
Полезный ориентир для практики: чтобы измерить свою точность с погрешностью ±2 пункта, нужно около 2400 ставок. Это порядка года ежедневной работы, а не месяц.
Обратите внимание на структуру формулы. Множитель p × (1 − p) максимален при p = 0,5 и падает к краям, поэтому шум сильнее всего мешает там, где события примерно равновероятны, — то есть ровно на исходах футбольных матчей. Ставки на очевидных фаворитов с вероятностью около 0,9 дают куда более гладкую картинку, но именно они и создают рекламные проценты проходимости, ничего не говорящие о прибыли. Красивая стабильная статистика и осмысленная статистика — часто разные вещи.
Наши числа: 51,2% против 49,2%
Теперь применим всё это к себе. Есть два числа, полученные разными способами.
| Выборка | Матчей | Угадано исходов | Интервал 95% |
|---|---|---|---|
| Бэктест на истории | 21 544 | 51,2% | от 50,5% до 51,9% |
| Живой трек-рекорд, с 30 июня 2026 | 329 | 49,2% | от 43,8% до 54,6% |
Живая цифра на два пункта ниже бэктестовой, и соблазн сделать вывод велик: модель на истории выглядит лучше, чем в бою. Считаем: интервал вокруг 49,2% на 329 матчах — от 43,8% до 54,6%, и бэктестовые 51,2% лежат внутри с большим запасом. Никакого противоречия в данных нет, есть выборка, которой пока мало.
Честно назовём и то, чего этот расчёт не доказывает. Он не доказывает, что модель в бою работает так же хорошо, как на истории, — он лишь показывает, что данных не хватает, чтобы утверждать обратное. Разница между «доказано, что нет разницы» и «разницу пока не видно» существенная, и продавцы прогнозов регулярно ею пользуются.
Ловушка разрезов: 45,3% и 52,1%
Дисперсия особенно коварна, когда выборку начинают резать. Вот наш живой трек-рекорд, разделённый по типу турнира:
| Турниры | Матчей | Попаданий | Доля | Интервал 95% |
|---|---|---|---|---|
| Клубные лиги | 137 | 62 | 45,3% | от 37,0% до 53,6% |
| Квалификация еврокубков | 192 | 100 | 52,1% | от 45,0% до 59,2% |
Разрыв в 6,8 процентного пункта выглядит как готовый вывод: «модель лучше работает на еврокубковой квалификации». Проверим его арифметикой. Стандартная ошибка разности двух долей — корень из суммы их квадратов ошибок: 0,453 × 0,547 / 137 плюс 0,521 × 0,479 / 192, корень из суммы даёт 0,056. Интервал для разности — ±10,9 пункта, и он спокойно накрывает ноль. Разницы, скорее всего, просто нет.
Отсюда общее правило: каждый новый разрез делит выборку и умножает шум. Прогнозист, который показывает вам точность «по домашним фаворитам в чемпионатах Скандинавии», почти наверняка показывает результат перебора срезов, а не найденную закономерность. Наши разрезы, включая этот, открыты целиком в трек-рекорде — вместе с разрезом, который выглядит невыгодно.
Кстати о срезах внутри среза. Из 329 боевых прогнозов 269 указывали на победу хозяев (135 попаданий, 50,2%) и 60 — на победу гостей (27 попаданий, 45,0%). Прогнозов «ничья» среди них ноль, и это не робость: ничья редко бывает самым вероятным из трёх исходов, о чём подробнее в статье про ставку на ничью.
Что спрашивать у прогнозиста
Из всего сказанного получается короткий чеклист, который работает и против нас.
Первое — размер выборки. Не «за июль», а сколько именно прогнозов и за какой период. Если число двузначное, дальше можно не смотреть: любой результат на такой выборке объясняется случаем.
Второе — полнота истории. Проценты считаются по всем прогнозам, а не по оставшимся после чистки. Единственная защита — фиксация до начала матча и открытый архив; как это проверить, разобрано в статьях о капперах и о проходимости прогнозов.
Третье — определение. Точность исхода 1X2, двойного шанса и «нескольких рынков» — три разных числа, и подменять их друг другом легко и незаметно.
Четвёртое — метрика калибровки. Её наличие отличает того, кто себя измерял, от того, кто себя рекламировал.
Калибровка: метрика, которую дисперсия не смывает
У доли угаданных есть фундаментальный недостаток: она выбрасывает почти всю информацию. Прогноз «60% на хозяев» и прогноз «95% на хозяев» засчитываются одинаково, хотя это принципиально разные заявления.
Калибровка проверяет другое — совпадают ли заявленные вероятности с реальными частотами. Берём все матчи, где модель обещала около 60%, и смотрим, в скольких из них событие случилось. Если примерно в 60% — модель калибрована. Средний разрыв по всем таким группам и называется ошибкой калибровки, ECE.
У нас она 0,007, то есть в среднем по всем группам заявленная вероятность расходится с фактической частотой примерно на 0,7 процентного пункта; до калибровочной поправки было 0,011. Оговорка тут существенная: это среднее по группам, а не гарантия для каждой из них — на отдельной группе расхождение может быть заметно больше. Зато утверждение проверяется на всей выборке сразу, а не на одной ставке, и потому устойчиво к дисперсии куда лучше, чем процент угаданных. Подробный разбор наших метрик — в статье о реальной точности прогнозов.
Границы этой арифметики
Формула стандартной ошибки предполагает независимые попытки с одинаковой вероятностью успеха. У ставок ни то ни другое не выполняется строго: матчи одного тура связаны общими факторами, а вероятность у каждого прогноза своя. Точный интервал в таких условиях считается сложнее, но грубая оценка выше даёт правильный порядок величины, и для практики этого достаточно.
Второе ограничение серьёзнее. Доля угаданных вообще не то, что определяет прибыль: ставки на фаворитов с низкими коэффициентами дают высокий процент и убыток. ROI шумит ещё сильнее процента — там к разбросу исходов добавляется разброс коэффициентов, и выборки нужны не сотни, а тысячи. Поэтому мы не выносим ROI в витрину: на нашей нынешней дистанции его знак ничего не доказывает.
И третье: длинная выборка честна только тогда, когда модель за это время не менялась. Любая правка обнуляет накопленное сравнение — и это ещё одна причина, по которой результаты бэктеста и живого трек-рекорда стоит держать раздельно, а не складывать в одну красивую цифру.
Как это используется в ГолПульс
Мы фиксируем каждый боевой прогноз до начала матча и грейдим после финального свистка, без права редактирования задним числом. Открыты и метрики, и разрезы, и выборка — в трек-рекорде, а методика описана в разделе как это работает. Прогнозы на ближайшие туры лежат в каталоге матчей.
Главная мысль этой статьи неудобна для любого сервиса прогнозов, включая наш: сегодняшним числам стоит верить ровно настолько, насколько велика выборка под ними. Через несколько сотен матчей 49,2% превратятся во что-то другое — и это будет не изменение модели, а сужение интервала. Другие разборы методов — в рубрике «Методы и модель».
Вопросы и ответы
Сколько ставок нужно, чтобы оценить прогнозиста?
Сотни. При истинной точности 52% выборка из 20 ставок даёт 95-процентный интервал около ±22 процентных пунктов, из 100 — ±10, из 1000 — ±3. Месячная статистика на паре десятков ставок не отличает работающую модель от бесполезной в принципе.
Как посчитать доверительный интервал для доли угаданных?
Стандартная ошибка доли — корень из p × (1 − p) / n, а 95-процентный интервал примерно вдвое шире: 1,96 стандартной ошибки в каждую сторону. Для 52% на 100 ставках это корень из 0,52 × 0,48 / 100 = 0,05, то есть ±9,8 процентного пункта.
Почему у одной модели точность на разных выборках разная?
Из-за размера выборки, а не из-за модели. У нас бэктест на 21 544 матчах даёт 51,2%, а живой трек-рекорд на 329 матчах — 49,2%. Интервал вокруг второго числа примерно от 43,8% до 54,6%, и первое лежит внутри: разница целиком объясняется шумом.
Что такое ECE и зачем эта метрика?
Ошибка калибровки: средневзвешенный по группам вероятностей разрыв между заявленным и фактическим. У нас она 0,007 — в среднем по всем группам расхождение около 0,7 процентного пункта, хотя на отдельной группе оно может быть заметно больше. Доля угаданных этого не показывает вовсе.
Может ли плюсовая стратегия долго быть в минусе?
Да, и это норма. На отрезке в несколько десятков ставок дисперсия перекрывает преимущество в несколько процентов с огромным запасом. Отличить неудачную серию от сломанной модели можно только по длинной выборке или по метрикам калибровки.
Источники
Проверьте модель на живых матчах
ГолПульс считает вероятности исходов и счёта для РПЛ и топ-лиг Европы. Регистрация даёт 3 бесплатных расчёта.
Начать бесплатно — 3 расчётаСервис носит информационно-аналитический характер и не является букмекером. Прогнозы — вероятностная оценка, а не гарантия результата. 18+
Читайте также
Как пользоваться вероятностями ГолПульс
Инструкция: как читать проценты на карточке матча, сравнивать их с коэффициентом и что означает класс пика. Честно про 51,2% и калибровку 0,007.
7 ошибок прогнозиста: разбор на своих данных
Семь ошибок прогнозиста с цифрами: интервал ±21,5 пункта на 20 прогнозах, 26,8% против фактических 40,3% и честный разбор своего трек-рекорда.
Live-вероятности: как счёт и удаления меняют прогноз
Как меняются live-вероятности по ходу матча: гол смещает всё распределение счёта, удаление меняет интенсивность, а минуты сжимают шансы отыграться.