АДАПТИВНЫЙ МЕТОД ФИЗИЧЕСКОЙ ОРГАНИЗАЦИИ ДАННЫХ В ОЗЕРЕ ДАННЫХ ТЕЛЕКОММУНИКАЦИОННОГО ОПЕРАТОРА

Ключевые слова

Аннотация

Рост объёмов данных детализации соединений (CDR) у операторов связи привёл к переходу от классических хранилищ к озёрам данных на колоночных форматах с отсечением файлов по блочной статистике. Эффективность отсечения полностью определяется физической раскладкой данных — набором ключей секционирования, порядком записей внутри секции и целевым размером файла. На практике эти параметры задаются вручную и по отдельности, что приводит либо к недостаточной кластеризации, либо к деградации из-за избыточного числа мелких файлов. В работе решается задача совместного выбора трёх параметров раскладки по наблюдаемому профилю аналитической нагрузки. Предложена аддитивная модель стоимости запроса, учитывающая, помимо объёма сканирования, поштучные расходы на открытие файлов и расходы на планирование по манифесту таблицы, не зависящие от селективности. Для многомерного упорядочивания по кривой Мортона выведена аналитическая оценка доли просматриваемых файлов, содержащая слагаемое граничного эффекта и объясняющая ухудшение отсечения при росте размерности порядка. Показано, что оценка систематически завышает объём сканирования для столбцов, функционально связанных с ключами упорядочивания; предложена поправка через индуцированную селективность с фильтрацией по силе функциональной зависимости. На основе модели построен алгоритм ADPC, включающий правило запуска компактизации по накопленному регрету с явной точкой безубыточности. Вычислительный эксперимент на смоделированном CDR-потоке (3·10⁶ записей, десять запросов с весами) показал: раскладка, выбранная алгоритмом, сокращает средневзвешенный объём сканирования в 2,73 раза и модельное время отклика в 2,55 раза относительно посуточного секционирования. Избыточное секционирование ухудшает время отклика на 7,8 % несмотря на меньший объём сканирования. Зависимость времени отклика от целевого размера файла немонотонна с минимумом при 16–32 МБ. Предложенная поправка снижает среднюю относительную ошибку модели с 70,4 % до 19,7 %.