Методология
Эта страница — обзор всей методологии проекта, написанный для читателя без специальной подготовки. Технические детали — в «Методике обработки» и «Источниках» (существующие подразделы), в методблоках каждого исследования и в файлах LIMITATIONS.md внутри каждого скачиваемого пакета.
Четыре типа утверждений
Всё, что публикует проект, относится к одному из четырёх типов, и мы стараемся никогда их не смешивать:
В интерфейсе карты каждая точка данных несёт пометку достоверности: перепись (самое надёжное), официальная оценка на 1 января, ретроспективная оценка (пересчёт в современных границах), вычислено (например, городское население суммой по городам), интерполяция (значения между опорными годами; они помечаются в тултипах и никогда не выдаются за измеренные).
Источники
Основные ряды населения: итоги одиннадцати переписей (1897, 1923, 1926, 1939, 1959, 1970, 1979, 1989, 1999, 2009, 2019) и официальные оценки Белстата до 2026 года — через компиляцию pop-stat.mashke.org, Демоскоп Weekly и «Демографический ежегодник Республики Беларусь». Возрастно-половые структуры: OLAP-кубы Белстата (переписи 2009/2019 «до человека») и API Белстата. Рождаемость и смертность: Human Fertility Database / Human Mortality Database. Международные сравнения: UN World Population Prospects 2024, Wittgenstein Centre. Границы: geoBoundaries, OpenStreetMap, Wikidata. Зеркальная статистика эмиграции: Eurostat (действующие ВНЖ), национальные ведомства Польши и Литвы. Чернобыльские перечни: официальные постановления pravo.by. Зарплаты: API Белстата по 118 районам. Ночная светимость: спутниковые композиты VIIRS.
Полный список с URL, лицензиями и датами обращения — в SOURCES.md и в sources/registry.csv каждого пакета.
Сбор и нормализация
Все сырые данные скачиваются скриптами и завендорены в репозиторий (HTML, JSON, GeoJSON, CSV) — исследование не зависит от доступности внешних сайтов и воспроизводится из архива. Из сырых файлов ETL-конвейер (Python) извлекает ряды, приводит названия и коды территорий к единому реестру и собирает итоговые наборы для сайта. Каждый шаг — детерминированный код; повторный запуск даёт байт-в-байт те же файлы.
Административно-территориальные изменения
Каноническая сетка — современное деление: 6 областей + Минск, 118 районов. Исторические значения приводятся к современным границам: страновые итоги 1897–1950 — ретроспективные пересчёты статведомства; областные итоги 1959 года приведены к современному составу областей (сумма областей обязана сходиться с итогом республики — это проверяет тест); районные ряды доступны с 1970 года, когда сетка районов стабилизировалась. Отдельно обработаны известные сложности: Дрибинский район (создан в 1989-м, отсутствует в базах границ — полигон вырезан из соседних районов по OSM), Орша и Полоцк (до 2013-го — города областного подчинения). Правило отображения: «весь район» всегда включает города, административно ему не подчинённые, но географически находящиеся внутри.
Плотность и динамика
Прогноз 2026–2075
Три сценария различаются предпосылками, а не методом:
- Базовый — рождаемость и смертность движутся по медианной траектории UN WPP 2024 (суммарный коэффициент рождаемости 1,23 → 1,45 к 2075-му), миграционный отток затухает до −1,7 тыс. в год. Итог: 9,06 млн (2026) → 7,53 млн (2050) → 5,97 млн (2075).
- Оптимистический — рождаемость растёт до 1,85, продолжительность жизни быстро догоняет соседей, миграционное сальдо становится положительным (+8 тыс. в год). Итог: 7,95 млн (2050) → 7,11 млн (2075).
- Негативный — рождаемость падает к 1,0–1,15, прогресс смертности почти останавливается, отток сохраняется десятилетиями (от −35 до −10 тыс. в год), концентрация в столице усиливается. Итог: 6,48 млн (2050) → 4,33 млн (2075).
Вокруг базового сценария построен вероятностный веер (Монте-Карло, 600 реализаций): 80-процентный интервал для 2050 года — от 7,04 до 8,05 млн. Кроме официального стартового ряда публикуется скорректированный («adjusted»): официальная статистика не видит большую часть эмиграции 2020–2026 годов, поэтому по зеркальной статистике стран приёма построен интервал неучтённого оттока 178–416 тыс. (центральная оценка 270 тыс.) и от уменьшенного старта прогнан тот же прогноз.
Горизонт до 2075 года — предел осмысленности: после 2050-го будут рожать люди, которые ещё не родились, и неопределённость нарастает лавинообразно (что и показывает расширяющийся веер).
Роль языковых моделей и агентных систем
LLM и агентные системы использовались как инструменты на всех этапах: поиск и систематизация источников, извлечение и нормализация данных, написание и ревью кода, поиск противоречий в данных и текстах, альтернативные расчёты, критика методологии, подготовка визуализаций и документирование. Ни один факт или вывод не взят «из головы» модели: всё, что утверждает проект, опирается на скачанный первоисточник или на вычисление открытым кодом. Обратная сторона того же принципа: каждый пакет артефактов содержит AGENT.md — инструкции для чужой LLM-системы, как проверить наши источники, воспроизвести расчёт и атаковать допущения.
Процедуры проверки
- Тесты-инварианты данных (155 автоматических тестов): суммы областей сходятся с итогом страны, реестр территорий взаимно однозначен, доли городского населения в переписные годы отличаются от официальных не более чем на 1,5 п.п., и т.д.
- Байт-воспроизводимость: перед публикацией каждый пакет пересобирается в чистом окружении и обязан совпасть с опубликованным байт-в-байт (гейт CI).
- Бэктесты прогноза: модель обучается на данных до 2009 года и «предсказывает» перепись-2019; ошибка национального итога — −0,4%, средняя ошибка по областям — 2,4% (наивная модель — 4,1%); для районов на окне 2019→2026 — 2,1% против 2,8% наивной, для городов — 6,7% против 10,9%.
- Внешняя калибровка: базовый сценарий на 2050 год отличается от медианы UN WPP 2024 на +1,0% (гейт ±3%); интервал оттока сверен с независимыми оценками (BEROC, МВД).
- Кросс-проверка независимым методом: исследование «Ночные огни» сверяет официальную динамику населения со спутниковой светимостью; «ML-челленджер» ищет систематические ошибки структурной модели районов машинным обучением.
Ограничения
Главные задекларированные ограничения (полные списки — в методблоках и LIMITATIONS.md):
- районного уровня до 1970 года нет (сетка районов многократно менялась);
- ретроспективные оценки 1897–1950 надёжнее для страны в целом, чем для отдельных территорий; городское население до 1959-го занижено на малые местечки;
- оценки 2021–2026 — официальные; они не видят неучтённую эмиграцию (для этого и построен adjusted-ряд, но он — модель, а не измерение);
- площади и плотности зависят от генерализации полигонов;
- корреляционные результаты (зарплаты, доступность, моногорода) — ассоциации, не доказательства причинности;
- прогноз наследует все ограничения стартовых данных, а его базовая рождаемость (1,23 по WPP) выше некоторых независимых оценок текущего уровня (~1,0–1,1) — базовый сценарий может быть смещён в оптимизм.
Потенциальные ошибки и неопределённости
Мы считаем наиболее вероятными источниками ошибок: неучтённую эмиграцию 2020–2026 (интервал широк, 178–416 тыс., и опирается на зеркальную статистику с её собственными искажениями); качество ретроспективных пересчётов первой половины XX века; несопоставимость определений («городское население», «уехавший») между эпохами и ведомствами; и человеческий фактор при ручной курации реестров (моногорода, чернобыльские перечни). Следующая перепись (~2030) позволит проверить и пересчитать ключевые оценки — проект спланирован так, чтобы это было легко сделать.