Этап в управлении данными;Исследование, в котором данные собирает исследователь (Investigator study);Исследование с использованием существующих баз данных (Data base study)
Планирование;Планирование управления данными строится как в классическом НИ: заранее определяется структура ИРК/EDC, перечень собираемых переменных, процедуры контроля качества и роли участников [11].;Исходные данные уже существуют в локальных ЭМК и архивах отдельных центров, а также в централизованных регистрах, страховых и административных базах. На этапе планирования проводится оценка осуществимости (feasibility) и полноты данных. Дизайн и протокол подстраиваются под реальные ограничения этих массивов [12].
Картирование данных (data mapping);На этом этапе проводится инвентаризация доступных источников данных (регистры, ЭМК, бумажные архивы). Оценивается принципиальная возможность доступа к ним и структура данных. Выбор дизайна (Database или Investigator study) часто зависит от результатов картирования.;Систематически описывается структура источников РКП: какие таблицы и поля доступны, где и как зафиксированы экспозиции, исходы и ковариаты, какие используются кодировки и форматы, какие временные окна наблюдения возможны. Это касается как локальных систем отдельных ЛПУ, так и централизованных репозиториев [11].
Разработка спецификаций извлечения;Формируются спецификации выгрузки из ИРК/EDC, регистров и других баз, а также аннотированная ИРК, связывающая поля источника с целевыми переменными исследования [10].;Разрабатываются спецификации для формирования запросов к исходным базам данных (SQL-запросы, правила логического вывода), определяются критерии включения на уровне данных и алгоритмы дедупликации записей [13].
Получение разрешений и организация доступа;Заключаются договоры с ЛПУ и/или отдельными исследователями, определяются ответственность сторон, порядок предоставления доступа к медицинской документации и условия обезличивания. Утверждаются процедуры передачи данных исследовательской группе и хранения исходной документации [1].;Заключаются договоры с владельцами баз данных и регистров, согласуются уровни обезличивания, режимы доступа (on-site, удалённый доступ, передача обезличенных выгрузок), форматы и периодичность предоставления данных. Доступ к ретроспективным данным требует согласования маршрутов передачи и требований по безопасности[13].
Планы исследования;План управления данными (DMP), описывающий структуру ИРК/EDC, процедуры ввода и проверки данных, процесс разрешения запросов (queries), архивацию. План валидации данных (DVP) с перечнем автоматических и ручных проверок [14].;План управления данными (DMP), с акцентом на спецификации выгрузок, объединение массивов из разных источников и контроль качества уже сформированных ретроспективных наборов данных. План валидации (DVP) описывает проверки на уровне наборов данных (логические, технические, содержательные). План трансфера данных — описание процедуры передачи файлов, контроля целостности и версий наборов [15].
Извлечение данных / Трансфер данных (ETL);Данные вводятся исследователем или уполномоченным персоналом в ИРК/EDC на основании первичных медицинских документов, преимущественно вручную. Возможна частичная автоматизация (импорт лабораторных результатов, интеграция с локальными системами), но основным остаётся контролируемый ввод с последующей валидацией в EDC [16].;Осуществляется выгрузка исторических данных по согласованным спецификациям: полуавтоматически из локальных ЭМК и регистров либо централизованно из единой базы (ETL-процессы). Возможно применение моделей NLP для извлечения структурированных признаков из неструктурированных текстов (врачебных записей). Основной объём — электронный трансфер данных из исходных систем [14].
Валидация данных;Принципиальное отличие в подходах валидации данных основано на способе сбора данных. В Investigator study валидация ориентирована на процесс ввода данных в EDC.; Data base study валидация строится вокруг анализа качества готовых наборов.
Оценка полноты и систематических смещений;Cпецифично для Investigator study.Оценивается полнота заполнения ИРК/EDC по ключевым переменным, доля пропусков и несвоевременных записей, соответствие фактического набора включённых пациентов плану набора. Анализируются различия между центрами по уровню полноты и качеству заполнения [19].;Не применимо как отдельный этап (данные уже зафиксированы, оценка полноты является частью валидации наборов данных).
Обогащение и линковка данных;При необходимости в ИРК/EDC могут добавляться данные из дополнительных источников (например, досчет индексов коморбидности или импорт из лабораторных систем). Однако линковка с внешними базами (регистрами) часто ограничена организационными и этическими рамками конкретного исследования и требует отдельного разрешения [17]. Процедуры описываются в протоколе.;Данные связываются с другими источниками (регистры смертности, специализированные реестры) по идентификаторам пациентов или с использованием алгоритмов вероятностного связывания. Это позволяет расширить набор исходов и ковариат и повысить полноту наблюдения. Ключевая особенность: В Data base study возможно пролонгированное обогащение — повторное обращение к источникам данных через несколько месяцев или лет после начала исследования для дозаписи событий, произошедших за прошедший период (follow-up data collection), что позволяет актуализировать и удлинить временные ряды наблюдения без повторного набора пациентов.
Формирование аналитических наборов и документирование трансформаций;Создаются конечные наборы данных с реализованными алгоритмами определения экспозиции, исходов, временных окон и обработкой пропусков для всего объединённого массива (локальные центры + регистры/базы, если они используются) . Суть формирования набора одинакова, но путь – разный. На основе ИРК/EDC создаются аналитические наборы с реализованными алгоритмами определения экспозиции, исходов и временных окон, а также с обработкой пропусков и выбросов. Все шаги трансформации (правила включения/исключения записей, пересчёты, перекодировки) документируются в спецификациях и/или программном коде [17].;Создаются конечные наборы данных с реализованными алгоритмами определения экспозиции, исходов, временных окон и обработкой пропусков для всего объединённого массива (локальные центры + регистры). Процесс включает финальную валидацию и подготовку данных к статистическому анализу [20].