На самом деле то, что приводится в статье Ballantyne et al (2010) и других подобных статьях, совершенно неприменимо для реальных расчетов в ДНК-генеалогии. Может в судебной практике это и полезно, но не при расчетах времен жизни общих предков.
На первый взгляд кажется, что в той статье – замечательная статистика, и вот наконец-то получены данные, которые позволят откорректировать скорости мутаций для протяженных гаплотипов и вывести ДНК-генеалогию на новый количественный уровень. Закончились споры и дискуссии, какие величины скоростей мутации самые правильные, и осталось только щелкать древние (и современные) гаплотипы как орехи. Видимо, этой эйфорией прониклись и сами авторы, поскольку в абстракте статьи написано черным по белому, после фразы, что теперь можно анализировать как близких, так и удаленных родственников «This finding is expected to revolutionize Y-chromosomal applications…»
Увы, не тут-то было.
Во-первых, поскольку мутации в гаплотипах обычно редки, то этих почти двух тысяч пар отец-сын явно недостаточно для хорошей статистики. Во многих маркерах мутаций не было вообще, в большинстве маркеров по одной-две-три мутации на все две тысячи пар, что вовсе немного для статистики. Понятно, что если мутаций в маркере вообще нет, то он остается неохарактеризованным. Одна мутация означает статистическую погрешность плюс-минус 100 %, поскольку где одна мутация, то там легко могло быть две или ни одной. Это можно показать и количественно, в терминах математической статистики. Две мутации – это погрешность примерно плюс-минус 70 %. Ясно, что о расчетах на основе отдельных маркеров здесь не может быть и речи. Не случайно в предыдущих статьях на эту тему я писал, что для статистически надежных данных нужны серии из сотен тысяч, а то и миллионов пар отец-сын, что практически нереально, пока, во всяком случае.
Во-вторых, для каждого маркера изучалось разное количество пар отец-сын. Это почти неизбежная проблема в таких массовых исследованиях, поскольку часто имеют место сбои, аллели не определяются, лаборанты ошибаются, а переделывать – дорого и неохота. Скорее второе, чем первое. В итоге итоговая таблица данных выглядит как лоскутное одеяло, с массой прорех. Но это самая незначительная проблема, поскольку данные можно пересчитать на некую «нормированную» величину, что мы ниже и сделаем двумя способами.
В-третьих, авторы не ориентировались на ДНК-генеалогию, а преследовали свои цели. В итоге ряд важных маркеров определен вообще не был, а именно из 37- и 67-маркерной панелей. Поэтому для этих расчетов, с использованием наиболее ценных, протяженных гаплотипов, данные обсуждаемой статьи вообще непригодны.
В-четвертых, и это очень важно, данные в парах отец-сын имеют принципиальный, системный недостаток в рамках понятий ДНК-генеалогии.