Литмир - Электронная Библиотека

Представьте себе анализ даже такого сравнительно небольшого, хотя и гетерогенного региона, как Кавказ. Пусть Вам необходимо проанализировать данные только по классическим маркёрам. Однако подобные данные получали и публиковали самые разные авторы — от медицинских исследований групп крови АВ0 и резус, до работ по многим системам, выполненными в московских и кавказских генетических лабораториях. Некоторые данные по Кавказу публиковались и зарубежными авторами. Библиография данных о Кавказе насчитывает многие десятки наименований, и далеко не все эти статьи легко доступны, а многие из них даже неизвестны большинству исследователей. Итак, тому, кто решит провести геногеографическое изучение Кавказа, предстоит провести сперва большую работу по сбору и систематизации данных о частотах генов, опубликованных за несколько десятилетий. Если же представить, сколько разных генофондов было изучено геногеографами, и вообразить, какой объём предварительной работы требуется, к примеру, для анализа в масштабе СССР, то задача сбора и систематизации опубликованных генетических данных предстанет во всем своем величии и неприступности.

Кардинальное решение этой задачи может быть только одно — собрать ВСЕ когда-либо опубликованные данные по частотам генов в ЕДИНОЕ хранилище. И при анализе любого генофонда лишь обращаться в хранилище и брать готовые систематизированные данные по частотам генов в популяциях интересующего региона.

Именно таким хранилищем и стал банк данных «GENEPOOL», разработанный под руководством одного из авторов этой книги. В банк данных вводилась практически вся доступная информация по частотам классических маркёров в популяциях Северной Евразии, а отчасти и по другим регионам мира. Впоследствии банк был пополнен и данными по аутосомным ДНК маркёрам. Структурная организация банка и запрограммированные функции делают его не только хранилищем данных, но и инструментом их проверки, систематизации и анализа. Аналогичный банк данных создавался и зарубежной геногеографической школой Кавалли-Сфорца. Он содержит информацию по остальным регионам мира (кроме Северной Евразии, представленной весьма скудно), хотя запрограммированные возможности этого банка не столь обширны.

Отечественной геногеографической школой создавался и ряд других банков данных: «ПАЛЕОЛИТ РОССИИ», база данных о русских фамилиях, банк данных по митохондриальной ДНК в населении мира и банк данных «РУССКИЙ ГЕНОФОНД» кратко описаны в разделе 5 Приложения.

ЦЕЛЬ — СИНТЕТИЧЕСКИЕ КАРТЫ

Использование банка данных является первым необходимым шагом при картографическом анализе любого гена. Но на всех этапах разработки картографической технологии главной целью оставалось картографирование не отдельных генов, а извлечение из карт отдельных генов общей информации о генофонде. Общепринятым методом обобщения тогда был (и остаётся доныне) анализ главных компонент. Этот статистический метод позволяет в изменчивости множества признаков выделить основные тенденции и представить их в изменчивости немногих новых условных признаков — главных компонент. Это метод чисто статистический, но чтобы сделать его картографическим, нужно, казалось бы, совсем немного — рассчитать значения главных компонент для каждой популяции и нанести их на карту.

Сложность заключается в том, что разные гены изучены в разных популяциях, а для расчёта главных компонент необходимы данные о значении каждого гена в каждой популяции. Решить эту проблему можно было лишь с помощью карт, основанных на цифровых матрицах. Ведь для таких карт мы имеем значение признака в каждой точке карты. А для другого признака — опять-таки знаем его значение в каждой из тех же самых точек. Таким образом, расчёт главных компонент проводится не по исходным данным, а по картам. Точнее, по картографированным (интерполированным) значениям в каждой точке карты (каждом узле регулярной сетки карты). Карты главных компонент строились и технологией «чернильных пятен». Но когда была создана технология картографирования на основе средневзвешенной интерполяции, и был разработан алгоритм проведения с цифровой матрицей математических операций, то создание карт главных компонент в отечественной геногеографической школе стало обычной и широко используемой процедурой.

Каково же было удивление, когда на этом этапе обнаружилось, что в зарубежных статьях (к тому же не в самых последних, а давностью в несколько лет) уже опубликованы карты главных компонент генофонда! Впрочем, изумление перед этим фактом быстро сменилось сознанием того, что такое совпадение подтверждает правильность избранного пути, а также ту огромную востребованность в геногеографии общих параметров генофонда, которая назрела в мировой науке.

Очевидно, именно такой была общая логика развития популяционной генетики в 70е и 80е годы, как за рубежом, так и в нашей стране: 1) необходимо обобщить данные о многих генах; 2) был общепринятый метод обобщения — главные компоненты; 3) для содержательной интерпретации результатов нужно было знать географию главных компонент, то есть построить для них карты; 4) для расчёта необходимы данные по каждому признаку в каждой точке карты; 5) получить такие данные возможно только при картографировании каждого признака, причём самым главным результатом картографирования должна быть не сама графическая карта, а лежащая в её основе матрица точных значений признака в каждом узле карты.

Самое забавное, что вместо разочарования и глубокого огорчения, что приоритет синтетических карт остался закреплён не за нами, основным чувством была радость

— нам стало намного проще объяснять, сколь необходимы геногеография и компьютерные картографические технологии. Если до этого солидные члены солидного Ученого совета заявляли, что подобные нашим контурные карты они рисовали в пятом классе, и нечего заниматься такими пустяками в Академии наук, то теперь авторитет «заграничных» исследований и популярность синтетических карт в мировой науке позволила нам развернуть куда более обширную работу и у нас в России.

CAVALLI-SFORZA И ЕГО ШКОЛА

Публикации карт главных компонент, о которых мы только что рассказали, принадлежали коллективу, который возглавлял Луиджи Лука Кавалли-Сфорца. Сразу оговоримся, что с историей зарубежной геногеографии авторы знакомы существенно меньше, чем с историей отечественной науки. Поэтому очертим её лишь несколькими штрихами и назовём только два имени.

Первое из них принадлежит А. Е. Mourent, организатору и автору крупнейшей сводки данных о частотах генов в населении мира [Mourent et al., 1976]. Этот прекрасный труд сыграл огромную роль для развития геногеографии. На страницах этой книги были сведены данные, кропотливо собранные из сотен публикаций разных лет, причём для каждой изученной популяции приводились подробные сведения о её географическом положении, отнесении к основным регионам мира, характере выборке (пациенты, здоровые, военнослужащие, коренное или «смешанное» население), а также подробная библиографическая ссылка на исходную публикацию этих данных. Для самых изученных генов были приведены и карты их распространения в мире. По сути, этот труд явился прообразом банка данных о генофонде популяций всего мира, а по полноте и объёму данных по классическим маркёрам он не утратил своего значения и сейчас.

Второе имя хорошо известно каждому, кто хотя бы бегло знаком с работами по популяционной генетике человека. Лаборатория и научная школа L. L. Cavalli-Sforza являются, пожалуй, наиболее известными в мировой науке. Этим коллективом выполнен целый ряд ставших классическими работ: по совершенствованию методов расчёта генетических расстояний, построению кластеров родства популяций, анализу фамилий как аналога генетических маркёров и множество иных исследований. Именно перу Кавалли-Сфорца принадлежит крупнейшая обобщающая монография в области популяционной генетики человека [Cavalli-Sforza et al., 1994]. Для нашего рассказа наиболее важно, что именно этим коллективом была независимо разработана картографическая технология, в общих чертах аналогичная технологии, созданной отечественной геногеографической школой. Именно эта технология легла в основу названного обобщающего труда, в котором не только приведены геногеографические карты для регионов всего мира, но и дано тщательное описание их генофондов.

229
{"b":"970748","o":1}