Метадалогія
Гэтая старонка — агляд усёй метадалогіі праекта, напісаны для чытача без спецыяльнай падрыхтоўкі. Тэхнічныя дэталі — у «Методыцы апрацоўкі» і «Крыніцах» (існуючыя падраздзелы), у метадблоках кожнага даследавання і ў файлах LIMITATIONS.md унутры кожнага пакета для спампоўвання.
Чатыры тыпы сцвярджэнняў
Усё, што публікуе праект, належыць да аднаго з чатырох тыпаў, і мы імкнёмся ніколі іх не змешваць:
[Даныя] — назіраныя значэнні з першакрыніц: вынікі перапісаў, афіцыйныя ацэнкі Белстата, статыстыка Eurostat. Прыклад: перапіс 2019 года — 9 413 446 чалавек.
[Разлік] — паказчыкі, вылічаныя з даных па адкрытых формулах: шчыльнасць, долі, індэксы, сумы гарадскога насельніцтва. Прыклад: доля Мінска ў насельніцтве краіны — 21,9% на 2025 год.
[Мадэль] — вынікі мадэльных пабудоў з яўнымі перадумовамі: прагнозныя сцэнарыі, контрфакт «нулявой міграцыі», скарэкціраваны рад насельніцтва. Мадэль слушная роўна настолькі, наколькі слушныя яе перадумовы.
[Інтэрпрэтацыя] — аўтарскія тлумачэнні і гіпотэзы аб прычынах назіранага. Яны аргументаваныя, але не даказаныя данымі.
У інтэрфейсе карты кожная кропка даных нясе пазнаку дакладнасці: перапіс (самае надзейнае), афіцыйная ацэнка на 1 студзеня, рэтраспектыўная ацэнка (пералік у сучасных межах), вылічана (напрыклад, гарадское насельніцтва сумай па гарадах), інтэрпаляцыя (значэнні паміж апорнымі гадамі; яны пазначаюцца ў тултыпах і ніколі не выдаюцца за вымераныя).
Крыніцы
Асноўныя рады насельніцтва: вынікі адзінаццаці перапісаў (1897, 1923, 1926, 1939, 1959, 1970, 1979, 1989, 1999, 2009, 2019) і афіцыйныя ацэнкі Белстата да 2026 года — праз кампіляцыю pop-stat.mashke.org, Дэмаскоп Weekly і «Дэмаграфічны штогоднік Рэспублікі Беларусь». Узростава-палавыя структуры: OLAP-кубы Белстата (перапісы 2009/2019 «да чалавека») і API Белстата. Нараджальнасць і смяротнасць: Human Fertility Database / Human Mortality Database. Міжнародныя параўнанні: UN World Population Prospects 2024, Wittgenstein Centre. Межы: geoBoundaries, OpenStreetMap, Wikidata. Люстраная статыстыка эміграцыі: Eurostat (дзейныя віды на жыхарства), нацыянальныя ведамствы Польшчы і Літвы. Чарнобыльскія пералікі: афіцыйныя пастановы pravo.by. Заробкі: API Белстата па 118 раёнах. Начная свяцільнасць: спадарожнікавыя кампазіты VIIRS.
Поўны спіс з URL, ліцэнзіямі і датамі звароту — у SOURCES.md і ў sources/registry.csv кожнага пакета.
Збор і нармалізацыя
Усе сырыя даныя спампоўваюцца скрыптамі і завендораныя ў рэпазіторый (HTML, JSON, GeoJSON, CSV) — даследаванне не залежыць ад даступнасці знешніх сайтаў і ўзнаўляецца з архіва. З сырых файлаў ETL-канвеер (Python) здабывае рады, прыводзіць назвы і коды тэрыторый да адзінага рэестра і збірае выніковыя наборы для сайта. Кожны крок — дэтэрмінаваны код; паўторны запуск дае байт-у-байт тыя самыя файлы.
Адміністрацыйна-тэрытарыяльныя змены
Кананічная сетка — сучасны падзел: 6 абласцей + Мінск, 118 раёнаў. Гістарычныя значэнні прыводзяцца да сучасных межаў: краінавыя вынікі 1897–1950 — рэтраспектыўныя пералікі статведамства; абласныя вынікі 1959 года прыведзеныя да сучаснага складу абласцей (сума абласцей абавязаная сыходзіцца з вынікам рэспублікі — гэта правярае тэст); раённыя рады даступныя з 1970 года, калі сетка раёнаў стабілізавалася. Асобна апрацаваныя вядомыя складанасці: Дрыбінскі раён (створаны ў 1989-м, адсутнічае ў базах межаў — палігон выразаны з суседніх раёнаў па OSM), Орша і Полацк (да 2013-га — гарады абласнога падпарадкавання). Правіла адлюстравання: «увесь раён» заўсёды ўключае гарады, адміністрацыйна яму не падпарадкаваныя, але геаграфічна размешчаныя ўнутры.
Шчыльнасць і дынаміка
[Разлік] Шчыльнасць = насельніцтва / плошча палігона тэрыторыі. Плошчы вылічаныя па генералізаваных палігонах, таму ў асобных тэрыторый адрозніваюцца ад даведачных на долі працэнта (сума па краіне: 206,9 тыс. км² пры даведачных 207,6). Дынаміка да базавага года = P(год)/P(база) − 1; базавы год выбірае карыстальнік. Рэжым «раён без цэнтра» аднімае ад раёна яго райцэнтр і гарады абласнога падпарадкавання — так відаць уласна сельская і малагарадская дынаміка. Паказчыкі канцэнтрацыі: доля Мінска, доля «Мінск + 5 абласных цэнтраў», доля сямі найбуйнейшых гарадоў.
Прагноз 2026–2075
[Мадэль] Для краіны, абласцей і Мінска выкарыстоўваецца класічны кагортна-кампанентны метад (CCMPP): насельніцтва разбіваецца на 5-гадовыя ўзростава-палавыя групы, кожная пяцігодка «старэе» з каэфіцыентамі дажыцця, дадаюцца нараджэнні (па ўзроставых каэфіцыентах нараджальнасці) і міграцыя. Для 118 раёнаў — метад Гамільтана–Пэры: кагортныя каэфіцыенты змены, ацэненыя па перапісах 2009→2019, са згладжваннем малых кагорт і ўзгадненнем раённых сум з абласнымі вынікамі (IPF). Для ~200 гарадоў — лагістычны трэнд долі горада ў насельніцтве свайго раёна; абласныя цэнтры лічацца ўласнымі кагортнымі мадэлямі.
Тры сцэнарыі адрозніваюцца перадумовамі, а не метадам:
- Базавы — нараджальнасць і смяротнасць рухаюцца па медыяннай траекторыі UN WPP 2024 (сумарны каэфіцыент нараджальнасці 1,23 → 1,45 да 2075-га), міграцыйны адток згасае да −1,7 тыс. на год. Вынік: 9,06 млн (2026) → 7,53 млн (2050) → 5,97 млн (2075).
- Аптымістычны — нараджальнасць расце да 1,85, працягласць жыцця хутка даганяе суседзяў, міграцыйнае сальда становіцца дадатным (+8 тыс. на год). Вынік: 7,95 млн (2050) → 7,11 млн (2075).
- Негатыўны — нараджальнасць падае да 1,0–1,15, прагрэс смяротнасці амаль спыняецца, адток захоўваецца дзесяцігоддзямі (ад −35 да −10 тыс. на год), канцэнтрацыя ў сталіцы ўзмацняецца. Вынік: 6,48 млн (2050) → 4,33 млн (2075).
Вакол базавага сцэнарыя пабудаваны імавернасны веер (Монтэ-Карла, 600 рэалізацый): 80-працэнтны інтэрвал для 2050 года — ад 7,04 да 8,05 млн. Акрамя афіцыйнага стартавага рада публікуецца скарэкціраваны («adjusted»): афіцыйная статыстыка не бачыць большай часткі эміграцыі 2020–2026 гадоў, таму па люстранай статыстыцы краін прыёму пабудаваны інтэрвал неўлічанага адтоку 178–416 тыс. (цэнтральная ацэнка 270 тыс.) і ад паменшанага старту прагнаны той самы прагноз.
Гарызонт да 2075 года — мяжа асэнсаванасці: пасля 2050-га будуць нараджаць людзі, якія яшчэ не нарадзіліся, і нявызначанасць нарастае лавінападобна (што і паказвае веер, які пашыраецца).
Роля моўных мадэляў і агентных сістэм
LLM і агентныя сістэмы выкарыстоўваліся як інструменты на ўсіх этапах: пошук і сістэматызацыя крыніц, здабыванне і нармалізацыя даных, напісанне і рэўю коду, пошук супярэчнасцяў у даных і тэкстах, альтэрнатыўныя разлікі, крытыка метадалогіі, падрыхтоўка візуалізацый і дакументаванне. Ніводзін факт або выснова не ўзятыя «з галавы» мадэлі: усё, што сцвярджае праект, абапіраецца на спампаваную першакрыніцу або на вылічэнне адкрытым кодам. Адваротны бок таго ж прынцыпу: кожны пакет артэфактаў утрымлівае AGENT.md — інструкцыі для чужой LLM-сістэмы, як праверыць нашы крыніцы, узнавіць разлік і атакаваць дапушчэнні.
Працэдуры праверкі
- Тэсты-інварыянты даных (155 аўтаматычных тэстаў): сумы абласцей сыходзяцца з вынікам краіны, рэестр тэрыторый узаемна адназначны, долі гарадскога насельніцтва ў перапісныя гады адрозніваюцца ад афіцыйных не больш чым на 1,5 п.п., і г.д.
- Байт-узнаўляльнасць: перад публікацыяй кожны пакет перазбіраецца ў чыстым асяроддзі і абавязаны супасці з апублікаваным байт-у-байт (гейт CI).
- Бэктэсты прагнозу: мадэль навучаецца на даных да 2009 года і «прадказвае» перапіс-2019; памылка нацыянальнага выніку — −0,4%, сярэдняя памылка па абласцях — 2,4% (наіўная мадэль — 4,1%); для раёнаў на акне 2019→2026 — 2,1% супраць 2,8% наіўнай, для гарадоў — 6,7% супраць 10,9%.
- Знешняе калібраванне: базавы сцэнарый на 2050 год адрозніваецца ад медыяны UN WPP 2024 на +1,0% (гейт ±3%); інтэрвал адтоку звераны з незалежнымі ацэнкамі (BEROC, МУС).
- Крос-праверка незалежным метадам: даследаванне «Начныя агні» звярае афіцыйную дынаміку насельніцтва са спадарожнікавай свяцільнасцю; «ML-чэленджар» шукае сістэматычныя памылкі структурнай мадэлі раёнаў машынным навучаннем.
Абмежаванні
Галоўныя задэклараваныя абмежаванні (поўныя спісы — у метадблоках і LIMITATIONS.md):
- раённага ўзроўню да 1970 года няма (сетка раёнаў шматразова змянялася);
- рэтраспектыўныя ацэнкі 1897–1950 больш надзейныя для краіны ў цэлым, чым для асобных тэрыторый; гарадское насельніцтва да 1959-га заніжана на малыя мястэчкі;
- ацэнкі 2021–2026 — афіцыйныя; яны не бачаць неўлічанай эміграцыі (для гэтага і пабудаваны adjusted-рад, але ён — мадэль, а не вымярэнне);
- плошчы і шчыльнасці залежаць ад генералізацыі палігонаў;
- карэляцыйныя вынікі (заробкі, даступнасць, монагарады) — асацыяцыі, не доказы прычыннасці;
- прагноз атрымлівае ў спадчыну ўсе абмежаванні стартавых даных, а яго базавая нараджальнасць (1,23 па ААН) вышэйшая за некаторыя незалежныя ацэнкі бягучага ўзроўню (~1,0–1,1) — базавы сцэнарый можа быць зрушаны ў аптымізм.
Патэнцыйныя памылкі і нявызначанасці
Мы лічым найбольш верагоднымі крыніцамі памылак: неўлічаную эміграцыю 2020–2026 (інтэрвал шырокі, 178–416 тыс., і абапіраецца на люстраную статыстыку з яе ўласнымі скажэннямі); якасць рэтраспектыўных пералікаў першай паловы XX стагоддзя; несупастаўнасць азначэнняў («гарадское насельніцтва», «той, хто з'ехаў») паміж эпохамі і ведамствамі; і чалавечы фактар пры ручной курацыі рэестраў (монагарады, чарнобыльскія пералікі). Наступны перапіс (~2030) дазволіць праверыць і пералічыць ключавыя ацэнкі — праект спланаваны так, каб гэта было лёгка зрабіць.