Введение
Многомерные типологии используются в региональной экономике для выделения территорий со сходными сочетаниями доходов населения, состояния рынка труда, инвестиционной активности и производительности. Они применяются не только для описания территориальной неоднородности, но и для обоснования дифференцированных мер региональной политики, сопоставления рынков труда, оценки инвестиционного потенциала и выявления территорий с близкими ограничениями развития. Поэтому ошибка в отнесении пограничного региона к определенному типу способна повлиять на содержательные выводы и приоритеты последующего анализа.
Кластерный анализ позволяет учитывать совместную структуру признаков, однако итоговое разбиение нередко интерпретируется как точное. Особенно чувствительны к статистической погрешности территории, расположенные в переходных зонах между кластерами: незначительное изменение одного или нескольких показателей может изменить их принадлежность, практически не влияя на общий внутригрупповой разброс. Поэтому внутренние критерии качества кластерного решения необходимо дополнять оценкой воспроизводимости состава групп. Для региональной экономики такая диагностика особенно важна при построении типологий рынков труда, инвестиционной привлекательности и социально-экономического положения, поскольку пограничное назначение не должно автоматически превращаться в жесткую содержательную категорию. Региональная неоднородность и различия рынков труда требуют осторожной интерпретации многомерных группировок [2; 4]. В статистическом обучении этот подход рассматривается как проверка устойчивости кластеризации при возмущении данных [5; 7].
Цель исследования состоит в разработке процедуры, позволяющей учитывать выборочную неопределенность социально-экономических показателей при построении региональной типологии. Методический вклад заключается в адаптации анализа устойчивости кластеризации к погрешности региональных показателей, оценивании частоты сохранения базового типа для каждого объекта и разграничении двух источников нестабильности: погрешности данных и случайности вычислительного алгоритма. Последняя в эксперименте фиксируется, чтобы измеряемая вариация отражала именно неопределенность исходных оценок.
Статистическая основа моделирования неопределенности
Региональная матрица может объединять показатели различной природы. Данные административного учета обычно относятся к наблюдаемой совокупности, тогда как результаты обследований населения и организаций являются оценками неизвестных параметров. Их точность зависит от объема и дизайна выборки, вариации признака, весов и обработки пропусков. Например, обследование рабочей силы формируется как выборочное наблюдение домашних хозяйств по субъектам Российской Федерации [3].
Пусть X₁, …, Xₙ — независимые одинаково распределенные случайные величины, для которых E(Xᵢ) = μ и Var(Xᵢ) = σ², где 0 < σ² < ∞. Выборочное среднее определяется выражением:
Теорема Бернулли чисел утверждает, что X̄ₙ сходится к μ по вероятности при n → ∞. Он объясняет стабилизацию выборочного среднего, но не устраняет систематическое смещение, возникающее из-за ошибок измерения, неполного охвата совокупности или некорректного дизайна выборки. При указанных выше условиях классическая центральная предельная теорема имеет вид:
Над стрелкой в формуле (2) указана сходимость по распределению. Формула относится к выборочному среднему и не требует нормальности исходного показателя. Для сложных обследований нормальное приближение допустимо лишь тогда, когда конкретная оценка обладает асимптотически нормальным распределением, а ее стандартная ошибка рассчитана с учетом дизайна обследования. Для рисунка 1 была сформирована искусственная совокупность из 200 000 наблюдений при начальном состоянии генератора 204, причем ln X ~ N(0; 0,85²). Из нее с возвращением формировались по 6000 выборок объемов n = 5 и n = 40.
Рис. 1. Распределение выборочного среднего при различном объеме выборки
Метод оценки устойчивости типологии
Пусть для n территориальных объектов сформирована матрица наблюдаемых оценок X̂ = (x̂ᵢⱼ) размерности n × p. Для каждой оценки x̂ᵢⱼ известна оцененная стандартная ошибка SEᵢⱼ либо относительная стандартная ошибка. При наличии микроданных неопределенность может оцениваться непараметрическим бутстрепом [6]. Если доступны только агрегированные оценки и нормальное приближение обосновано, формируются B смоделированных вариантов матрицы:
В формуле (3) случайные величины εᵢⱼ⁽ᵇ⁾ предполагаются независимыми по i, j и b; это частный случай параметрического моделирования. Если ошибки нескольких показателей коррелированы, следует использовать совместное многомерное распределение с оцененной ковариационной матрицей. Для долей, строго положительных величин и других ограниченных показателей применяются преобразования или распределения, сохраняющие допустимый диапазон. В каждом повторе матрица стандартизируется заново:
где
Делитель n соответствует реализации StandardScaler, использованной в вычислительном эксперименте; предполагается, что для каждого признака
sⱼ⁽ᵇ⁾ > 0.
На базовой стандартизированной матрице строится опорная типология с метками cᵢ⁽⁰⁾. Затем одна и та же спецификация кластерного алгоритма применяется ко всем смоделированным матрицам. Число кластеров, схема инициализации и параметры алгоритма фиксируются, поэтому вычислительная случайность не смешивается с погрешностью данных. Поскольку номера кластеров определены лишь с точностью до перестановки, для каждого повтора b выбирается перестановка меток, максимизирующая совпадение с опорным решением:
Здесь рассматриваются все перестановки K меток, а I(A) = 1, если условие A выполнено, и I(A) = 0 в противном случае. В расчетах задача согласования решалась как задача о назначениях функцией scipy.optimize.linear_sum_assignment. Для небольших наборов территорий аналогичная процедура может строиться на иерархическом методе Уорда [11].
Эмпирическая оценка индивидуальной устойчивости равна частоте сохранения исходного типа:
В отличие от максимальной частоты попадания в какой-либо кластер, оценка p̂ᵢ непосредственно характеризует воспроизводимость исходного назначения объекта. Средняя устойчивость типологии равна:
Порог p̂ᵢ < 0,8 используется только как диагностический и не является уровнем статистической значимости. При независимых повторах индикаторы в формуле (6) имеют распределение Бернулли, поэтому подстановочная оценка стандартной ошибки Монте-Карло имеет вид:
При B = 1200 и p̂ᵢ ≈ 0,8 одна стандартная ошибка составляет 0,0115, или около 1,2 процентного пункта; при нормальном приближении 95-процентная полуширина интервала равна 1,96 · 0,0115 ≈ 0,0226. Закон больших чисел обосновывает стабилизацию частот при увеличении B, но не доказывает содержательную корректность выбранного кластерного решения.
На рисунке 2 показана сходимость средней доли объектов, сохранивших базовое назначение, при среднем уровне погрешности. После нескольких сотен повторов колебания заметно уменьшаются, а к B = 1200 оценка стабилизируется на уровне, достаточном для поставленной диагностической задачи.
Рис. 2. Сходимость оценки доли сохраненных кластерных назначений
Вычислительный эксперимент
Для проверки процедуры сформирован модельный массив из 72 территориальных объектов и четырех показателей, условно интерпретируемых как доходы населения, инвестиции на душу населения, производительность труда и безработица. Массив включал три группы по 24 объекта. Наблюдения каждой группы генерировались из четырехмерного нормального распределения с соответствующим центром и общей диагональной ковариационной матрицей diag(0,48²; 0,50²; 0,46²; 0,44²). Векторы центров равнялись m₁ = (0,85; 0,75; 0,70; −0,65), m₂ = (0,05; 0; 0,05; 0) и m₃ = (−0,75; −0,70; −0,60; 0,75). Начальное состояние генератора при формировании массива равно 42. Такая конфигурация создает три частично перекрывающиеся группы и позволяет исследовать пограничные кластерные назначения.
Опорное решение получено алгоритмом k-средних при k = 3. Число кластеров было задано конструкцией модельного эксперимента; задача выбора k в данной статье не рассматривается. Во всех расчетах использовались евклидово расстояние и одинаковые параметры алгоритма: random_state = 42 и n_init = 20. Коэффициент силуэта базовой типологии составил 0,312 [10], что указывает на неполную разделенность кластеров. Затем к каждому показателю добавлялась независимая нормальная ошибка трех уровней: σ = 0,10; 0,30 и 0,60 в единицах исходной модельной шкалы; после каждого возмущения матрица стандартизировалась по формуле (4). Для сценариев использовались начальные состояния генератора 101, 102 и 103 соответственно. В каждом сценарии выполнено 1200 независимых повторов. Расчеты проведены на Python с использованием NumPy, SciPy и scikit-learn [9]. Результаты представлены в таблице 1.
При низкой погрешности средняя оценка устойчивости составила 0,959; у пяти объектов значение p̂ᵢ оказалось ниже диагностического порога 0,8. При среднем уровне ошибки S снизилась до 0,866, а число неустойчивых объектов увеличилось до 18. При высокой погрешности две трети объектов имели p̂ᵢ < 0,8. Коэффициент силуэта при этом изменялся в сравнительно узком диапазоне. Следовательно, геометрическая компактность конкретного разбиения не отражает полностью надежность индивидуальных кластерных назначений.
Таблица 1
Результаты повторного моделирования
|
Уровень ошибки |
Средний коэффициент силуэта |
Средняя устойчивость S |
Число объектов с p̂ᵢ < 0,8 |
|
Низкий, σ = 0,10 |
0,307 |
0,959 |
5 |
|
Средний, σ = 0,30 |
0,273 |
0,866 |
18 |
|
Высокий, σ = 0,60 |
0,245 |
0,700 |
48 |
Визуальная диагностика и интерпретация
Метод главных компонент используется как средство интерпретации, а не как доказательство существования кластеров [8]. На рисунке 3 представлена проекция базовой стандартизированной матрицы на первые две компоненты. Форма маркера показывает базовый тип, а заливка — устойчивость назначения в сценарии со средним уровнем погрешности. Контурными маркерами показаны объекты с p̂ᵢ < 0,8 при σ = 0,30.
Рис. 3. Проекция базовой матрицы и устойчивость кластерных назначений
Большинство неустойчивых объектов расположено в переходных областях между группами. Однако отдельные чувствительные назначения встречаются и внутри двумерной проекции кластера, поскольку две компоненты не сохраняют всю многомерную информацию. Поэтому график дополняет, но не заменяет расчет p̂ᵢ.
Для содержательного анализа устойчивые объекты могут рассматриваться как ядро типа. Для территории с низким p̂ᵢ целесообразно показывать распределение частот альтернативных назначений и отдельно анализировать исходные показатели. Неопределенность может отражать как статистическую погрешность, так и реальное сочетание признаков разных типов. Практическое применение требует стандартных ошибок официальных показателей и учета их зависимости; при отсутствии ковариационной структуры результаты следует трактовать как анализ чувствительности.
Метод имеет ограничения. Он оценивает устойчивость относительно выбранного числа кластеров и конкретной модели ошибок. Большое число повторов не исправляет неудачную спецификацию. Нормальное приближение может быть неприемлемым для малых выборок, редких событий и показателей у границ допустимого диапазона. Кроме того, модельный эксперимент не воспроизводит пространственную зависимость и неодинаковую надежность статистики разных регионов. Поэтому следующим этапом должна стать апробация на официальных данных за один выбранный год, не требующая анализа временных периодов.
Заключение
Предложенная процедура дополняет региональную кластеризацию оценкой надежности состава групп. Показатель p̂ᵢ является эмпирической оценкой частоты сохранения базового типа конкретным объектом при повторном моделировании статистической погрешности. Фиксация параметров кластерного алгоритма и согласование меток по формуле (5) позволяют отделить неопределенность данных от случайности инициализации и от произвольной нумерации кластеров.
Вычислительный эксперимент показал, что коэффициент силуэта и устойчивость назначений характеризуют разные стороны типологии. При росте погрешности коэффициент силуэта изменялся в сравнительно узком диапазоне, тогда как доля объектов с неопределенной принадлежностью существенно увеличивалась. Поэтому региональная типология должна представляться не только перечнем кластеров, но и индивидуальными оценками надежности. Такой формат позволяет отделить устойчивое ядро групп от пограничных территорий и делает выводы многомерного анализа более прозрачными.
Литература:
- Айвазян С. А. Прикладная статистика и основы эконометрики: учебник для вузов / С. А. Айвазян, В. С. Мхитарян. — Москва: ЮНИТИ, 1998. — 1022 с.
- Гранберг А. Г. Основы региональной экономики / А. Г. Гранберг. — 5-е изд. — Москва: Издательский дом ГУ ВШЭ, 2006. — 495 с.
- Основные методологические и организационные положения по проведению выборочного обследования рабочей силы: утверждены приказом Росстата от 29.12.2023 № 707: с изменениями, утвержденными приказом Росстата от 13.11.2024 № 547 [Электронный ресурс] // Федеральная служба государственной статистики: официальный сайт. — URL: https://rosstat.gov.ru/labour_force (дата обращения: 24.06.2026).
- Antonov E. V. Labor Market of Russian Regions and Municipalities in 2019–2022: A Multiscale View and Territorial Inequality / E. V. Antonov, A. V. Sheludkov // Regional Research of Russia. — 2025. — Vol. 15, no. 1. — P. 57–69. — DOI: 10.1134/S2079970525600027.
- Ben-Hur A. A Stability Based Method for Discovering Structure in Clustered Data / A. Ben-Hur, A. Elisseeff, I. Guyon // Pacific Symposium on Biocomputing. — 2002. — P. 6–17. — DOI: 10.1142/9789812799623_0002.
- Efron B. An Introduction to the Bootstrap / B. Efron, R. J. Tibshirani. — New York: Chapman & Hall, 1993. — 436 p.
- Hennig C. Cluster-wise Assessment of Cluster Stability / C. Hennig // Computational Statistics & Data Analysis. — 2007. — Vol. 52, no. 1. — P. 258–271. — DOI: 10.1016/j.csda.2006.11.025.
- Jolliffe I. T. Principal Component Analysis: A Review and Recent Developments / I. T. Jolliffe, J. Cadima // Philosophical Transactions of the Royal Society A. — 2016. — Vol. 374, no. 2065. — Art. 20150202. — DOI: 10.1098/rsta.2015.0202.
- Pedregosa F. Scikit-learn: Machine Learning in Python / F. Pedregosa [et al.] // Journal of Machine Learning Research. — 2011. — Vol. 12. — P. 2825–2830.
- Rousseeuw P. J. Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis / P. J. Rousseeuw // Journal of Computational and Applied Mathematics. — 1987. — Vol. 20. — P. 53–65. — DOI: 10.1016/0377–0427(87)90125–7.
- Ward J. H., Jr. Hierarchical Grouping to Optimize an Objective Function / J. H. Ward, Jr. // Journal of the American Statistical Association. — 1963. — Vol. 58, no. 301. — P. 236–244. — DOI: 10.1080/01621459.1963.10500845.
- Wasserman L. All of Statistics: A Concise Course in Statistical Inference / L. Wasserman. — New York: Springer, 2004. — 442 p.

