Наследие Чаргаффа, или Необычное свойство обычных геномов (часть 2)
Первая часть здесь.
К концу 90-х годов было доступно уже достаточно много секвенированных последовательностей. Тогда и обнаружилось, что второе правило Чаргаффа – это частный случай общего закона, который гласит: в одной цепочке ДНК находится примерно равное количество комплементарных олигонуклеотидов небольшой длины.
Что подразумевать под “небольшой длиной”? В работе 2002 года был проведен анализ геномов на содержание олигонуклеотидов длиной от 1 до 9 оснований. В целом тенденция такова: чем длиннее олигонуклеотиды, тем больше нарушается второе правило. Но даже для длины в 9 оснований ошибка ненамного меньше, чем для мононуклеотидов – около процента. В одной более поздней статье есть высказывание, что второе правило хорошо держится до олигонуклеотидов длиной в 30 оснований. Но это просто ляп, уж не знаю, чем вызванный. Дело в том, что найти в геноме человека заданный олигонуклеотид длиной даже в 20 оснований очень маловероятно, т.к. таких олигонуклеотидов более триллиона (4 в степени 20), а длина генома ~ 3 миллиарда. Что уж говорить про 30-олигонуклеотиды в геномах бактерий. Для большинства олигонуклеотидов такого размера комплементарные пары в геномах не найти, т.е. ошибка около 100%. По всей видимости, нарушение правила резко усиливается в диапазоне длин 10-16 оснований.
Вот пример распределения дублетов в 10-ой хромосоме человека. Распределения в других хромосомах практически не отличаются от этого.
Дублеты расставлены комплементарными парами, чтобы было лучше видно равенство их количеств. Последние четыре дублета самокомплементарные, поэтому "гуляют", как хотят (провал на CG характерен для эукариотных геномов, но особенно глубок у млекопитающих - также не совсем понятная фишка, со своими гипотезами).
Уточню определения. Обычно вторым правилом Чаргаффа именовалось равенство мононуклеотидов. Более общий закон в англоязычной литературе окрестили как "DNA strand symmetry" или "Intra-strand parity rule" (второй вариант лучше, т.к. не исключает однонитевые и РНК-овые геномы – о них ниже). Но и выражение “второе правило Чаргаффа” сейчас встречается наряду с ними для обозначения общего случая. Т.к. в русскоязычной литературе нет устоявшегося названия для этого феномена, то я буду для краткости именовать общий случай также вторым правилом Чаргаффа. “Симметрия цепочек ДНК по олигонуклеотидному составу” звучит слишком длинно, а аббревиатуры я предпочитаю избегать.
Почему речь идет о симметрии ДНКовых цепочек? Допустим, в одной цепи ДНК имеется N динуклеотидов TG. Согласно второму правилу Чаргаффа, в той же цепочке имеется примерно N динуклеотидов CA. Но согласно первому правилу, это означает, что на второй цепочке имеется ровно столько же комплементарных динуклеотидов TG. Вывод: динуклеотид TG представлен примерно в равных количествах в обеих цепочках. Это справедливо для любых олигонуклеотидов (не слишком больших). Другими словами, олигонуклеотидный состав обеих цепочек одинаковый, что и подразумевается под симметрией.
Как я уже говорил, второе правило универсально – ему строго подчинены все прокариоты и эукариоты, а также вирусы, содержащие двунитевую ДНК. Лишь геномы митохондрий позвоночных, маленькие плазмиды (в средних и больших плазмидах правило работает) и все вирусы, кроме dsDNA, не обнаруживают этого правила. Так обычно утверждается в имеющихся немногочисленных публикациях.
На самом же деле, правилу подчинены абсолютно все геномы, если исключить
флуктуации. Возьмем, например, ssDNA-вирусы. Типичный размер их генома – 2-4 тыс. оснований. На таких маленьких интервалах правило выполняется плохо в любых организмах (см. часть 1). Но выловить его в вирусах все же можно. Для этого нужно 4 нуклеотида разбить на две пары тремя возможными способами (AT:GC, AG:TC, TG:AC), и посчитать, в каком из этих случаев ошибка будет наименьшей. Ответ таков: в подавляющем большинстве случаев всех ssDNA-, ssRNA- и dsRNA-вирусов наименьшая разница наблюдается в случае AT:GC. Более того, некоторые однонитевые вирусы (напр., Human rhinovirus, Cherry virus A, Culex pipiens densovirus, Diatraea saccharalis densovirus) удовлетворяют второму правилу не хуже других геномов (ошибка около процента и менее).
По всей видимости, в этих геномах правило нарушается или выполняется плохо не потому, что они однонитевые или РНК-овые, а потому, что они маленькие. Но нужно заметить, что в невирусных геномах на этих же длинах правило выполняется все же точнее (в среднем).
То же самое касается маленьких плазмид и даже вироидов. Последние имеют размер 300-400 оснований, и в большинстве из них наименьшая разница также относится к парам AT:GC.
1. Когда была известна только мононуклеотидная симметрия, было высказано мнение, что она обуславливается одинаковым давлением отбора на точечные мутации в обеих цепях (Lobry J.R., 1999). Но когда правило обобщилось на случай олигонуклеотидов, этот вариант отпал.
2. Когда стало известно общее правило, появилась гипотеза (Forsdyke D.R., 2000), объясняющая его комплементарным спариванием оснований в одной нити ДНК. Такие участки имеются, например, в тРНК-овых генах - ведь в молекулах тРНК из них образуются шпильки. Другой пример - образование крестообразных структур в молекуле сверхспирализованной ДНК (что помогает снять напряжение). Но несложный компьютерный код позволяет эту гипотезу отвергнуть сразу – в геномах шпильки, конечно, обнаруживаются, но их слишком мало, чтобы объяснить высокую точность второго правила. Эта гипотеза, возможно, применима лишь к геномам вироидов – там действительно из одной нити, по-видимому, образуется вторичная структура через комплементарные участки в одной и той же цепи.
3. Гипотеза инверсий (Albreht-Buehler G., 2006, Okamura K. et.al., 2007). Инверсия – тип мутации, при которой участок ДНК, оторвавшись от хромосомы, вставляется обратно в перевернутом виде. Эта гипотеза существует в двух вариантах.
3а. Инверсии с дупликацией. Здесь очень просто – участок ДНК копируется и копия вставляется в другом месте в перевернутом виде, т.е. та последовательность, которая в оригинале находится на первой нити, в копии будет находиться на второй нити, и наоборот. Рисунок из статьи Окамуры: Очевидно, что если такого рода перестройки будут происходить в хромосоме повсеместно, со временем вся последовательность будет удовлетворять второму правилу все лучше и лучше, т.к. в обеих цепях будут накапливаться одинаковые последовательности.
Этой гипотезе противоречит компьютерный анализ геномов. Он не выявляет повсеместные инвертированные копии, даже при поиске с заданным процентом совпадений (копии могли накопить мутации). Ну, повторы, конечно, имеются. Геном человека вообще состоит наполовину (и даже больше) из повторов. Но, во-первых, все они не могут покрыть ту точность, с которой выполняется второе правило в геноме человека, а во-вторых, в геномах бактерий, например, повторов немного или даже нет вообще.
3б. Просто инверсии - самая ходовая гипотеза. Если участок ДНК не копируется, а просто переворачивается так, чтобы его нити поменялись местами – то это тоже ведет к установлению симметрии, даже без дупликации. Допустим, первоначально на одной нити находилось гораздо больше оснований A, чем T. Следовательно, на второй, комплементарной ей нити находилось больше T, чем A. Любая случайная инверсия будет приводить к тому, что избыточные на первой нити A-основания будут переходить на вторую нить, где их было мало, и в то же время избыточные T-основания со второй нити будут переходить на первую. Подробно об этой гипотезе можно почитать на сайте одного из авторов. Там есть поясняющие анимированные рисунки.
Это объяснение также сталкивается с немалыми трудностями:
4. Последняя из известных мне гипотез появилась два года назад (Zhang & Huang, 2008). Cтатья написана на китайском английском и по-китайски обстоятельна - Жанг и Хуанг не поленились даже расписать в ней названия четырехсот проанализированных бактерий, почти на 4 страницы, через запятую.
Если гипотеза инверсий утверждает, что второе правило выточилось в течение эволюции в геномах, изначально имевших произвольные распределения оснований, то китайская гипотеза гласит прямо противоположное – второе правило является пережитком первых геномов, а инверсии в лучшем случае поддерживают его от разрушения. Первичные геномы, по мнению авторов, состояли из повторяющихся элементов, причем число прямых и обратных (комплементарных) повторов было примерно одинаково, что и являлось причиной второго правила.
Претензия к этой гипотезе та же самая, что и к шпилькам и дуплицированным инверсиям: поиск в геномах (с поправкой на допустимую степень совпадений) показывает, что комплементарные копии не настолько вездесущи, чтобы объяснить высокую точность второго правила. Ну да, геномы могли с того времени так исказиться точечными мутациями, что сейчас от копий почти ничего и не осталось. Но почему эти мутации не нарушили точность второго правила?
Такие вот геномные пироги.
UPD:
Основное обсуждение в коммюнити ru_genetics.
Симметрия ДНКовых цепочек
К концу 90-х годов было доступно уже достаточно много секвенированных последовательностей. Тогда и обнаружилось, что второе правило Чаргаффа – это частный случай общего закона, который гласит: в одной цепочке ДНК находится примерно равное количество комплементарных олигонуклеотидов небольшой длины.
Что подразумевать под “небольшой длиной”? В работе 2002 года был проведен анализ геномов на содержание олигонуклеотидов длиной от 1 до 9 оснований. В целом тенденция такова: чем длиннее олигонуклеотиды, тем больше нарушается второе правило. Но даже для длины в 9 оснований ошибка ненамного меньше, чем для мононуклеотидов – около процента. В одной более поздней статье есть высказывание, что второе правило хорошо держится до олигонуклеотидов длиной в 30 оснований. Но это просто ляп, уж не знаю, чем вызванный. Дело в том, что найти в геноме человека заданный олигонуклеотид длиной даже в 20 оснований очень маловероятно, т.к. таких олигонуклеотидов более триллиона (4 в степени 20), а длина генома ~ 3 миллиарда. Что уж говорить про 30-олигонуклеотиды в геномах бактерий. Для большинства олигонуклеотидов такого размера комплементарные пары в геномах не найти, т.е. ошибка около 100%. По всей видимости, нарушение правила резко усиливается в диапазоне длин 10-16 оснований.
Вот пример распределения дублетов в 10-ой хромосоме человека. Распределения в других хромосомах практически не отличаются от этого.
Дублеты расставлены комплементарными парами, чтобы было лучше видно равенство их количеств. Последние четыре дублета самокомплементарные, поэтому "гуляют", как хотят (провал на CG характерен для эукариотных геномов, но особенно глубок у млекопитающих - также не совсем понятная фишка, со своими гипотезами).
Уточню определения. Обычно вторым правилом Чаргаффа именовалось равенство мононуклеотидов. Более общий закон в англоязычной литературе окрестили как "DNA strand symmetry" или "Intra-strand parity rule" (второй вариант лучше, т.к. не исключает однонитевые и РНК-овые геномы – о них ниже). Но и выражение “второе правило Чаргаффа” сейчас встречается наряду с ними для обозначения общего случая. Т.к. в русскоязычной литературе нет устоявшегося названия для этого феномена, то я буду для краткости именовать общий случай также вторым правилом Чаргаффа. “Симметрия цепочек ДНК по олигонуклеотидному составу” звучит слишком длинно, а аббревиатуры я предпочитаю избегать.
Почему речь идет о симметрии ДНКовых цепочек? Допустим, в одной цепи ДНК имеется N динуклеотидов TG. Согласно второму правилу Чаргаффа, в той же цепочке имеется примерно N динуклеотидов CA. Но согласно первому правилу, это означает, что на второй цепочке имеется ровно столько же комплементарных динуклеотидов TG. Вывод: динуклеотид TG представлен примерно в равных количествах в обеих цепочках. Это справедливо для любых олигонуклеотидов (не слишком больших). Другими словами, олигонуклеотидный состав обеих цепочек одинаковый, что и подразумевается под симметрией.
Универсальность
*** Для дальнейшего все же понадобятся сокращения. Вирусы могут содержать как ДНК, так и РНК, в обоих случаях они могут быть как однонитевыми, так и двунитевыми. Для краткости используются обозначения: dsDNA (double-stranded DNA) – двунитевая ДНК, ssDNA (single-stranded DNA) – однонитевая ДНК, тоже самое для dsRNA и ssRNA – двунитевая и однонитевая РНК) ***Как я уже говорил, второе правило универсально – ему строго подчинены все прокариоты и эукариоты, а также вирусы, содержащие двунитевую ДНК. Лишь геномы митохондрий позвоночных, маленькие плазмиды (в средних и больших плазмидах правило работает) и все вирусы, кроме dsDNA, не обнаруживают этого правила. Так обычно утверждается в имеющихся немногочисленных публикациях.
На самом же деле, правилу подчинены абсолютно все геномы, если исключить
| Human rhinovirus: однонитевая РНК хорошо удовлетворяет второму правилу. |
По всей видимости, в этих геномах правило нарушается или выполняется плохо не потому, что они однонитевые или РНК-овые, а потому, что они маленькие. Но нужно заметить, что в невирусных геномах на этих же длинах правило выполняется все же точнее (в среднем).
То же самое касается маленьких плазмид и даже вироидов. Последние имеют размер 300-400 оснований, и в большинстве из них наименьшая разница также относится к парам AT:GC.
Гипотезы
1. Когда была известна только мононуклеотидная симметрия, было высказано мнение, что она обуславливается одинаковым давлением отбора на точечные мутации в обеих цепях (Lobry J.R., 1999). Но когда правило обобщилось на случай олигонуклеотидов, этот вариант отпал.
2. Когда стало известно общее правило, появилась гипотеза (Forsdyke D.R., 2000), объясняющая его комплементарным спариванием оснований в одной нити ДНК. Такие участки имеются, например, в тРНК-овых генах - ведь в молекулах тРНК из них образуются шпильки. Другой пример - образование крестообразных структур в молекуле сверхспирализованной ДНК (что помогает снять напряжение). Но несложный компьютерный код позволяет эту гипотезу отвергнуть сразу – в геномах шпильки, конечно, обнаруживаются, но их слишком мало, чтобы объяснить высокую точность второго правила. Эта гипотеза, возможно, применима лишь к геномам вироидов – там действительно из одной нити, по-видимому, образуется вторичная структура через комплементарные участки в одной и той же цепи.
3. Гипотеза инверсий (Albreht-Buehler G., 2006, Okamura K. et.al., 2007). Инверсия – тип мутации, при которой участок ДНК, оторвавшись от хромосомы, вставляется обратно в перевернутом виде. Эта гипотеза существует в двух вариантах.
3а. Инверсии с дупликацией. Здесь очень просто – участок ДНК копируется и копия вставляется в другом месте в перевернутом виде, т.е. та последовательность, которая в оригинале находится на первой нити, в копии будет находиться на второй нити, и наоборот. Рисунок из статьи Окамуры: Очевидно, что если такого рода перестройки будут происходить в хромосоме повсеместно, со временем вся последовательность будет удовлетворять второму правилу все лучше и лучше, т.к. в обеих цепях будут накапливаться одинаковые последовательности.
Этой гипотезе противоречит компьютерный анализ геномов. Он не выявляет повсеместные инвертированные копии, даже при поиске с заданным процентом совпадений (копии могли накопить мутации). Ну, повторы, конечно, имеются. Геном человека вообще состоит наполовину (и даже больше) из повторов. Но, во-первых, все они не могут покрыть ту точность, с которой выполняется второе правило в геноме человека, а во-вторых, в геномах бактерий, например, повторов немного или даже нет вообще.
3б. Просто инверсии - самая ходовая гипотеза. Если участок ДНК не копируется, а просто переворачивается так, чтобы его нити поменялись местами – то это тоже ведет к установлению симметрии, даже без дупликации. Допустим, первоначально на одной нити находилось гораздо больше оснований A, чем T. Следовательно, на второй, комплементарной ей нити находилось больше T, чем A. Любая случайная инверсия будет приводить к тому, что избыточные на первой нити A-основания будут переходить на вторую нить, где их было мало, и в то же время избыточные T-основания со второй нити будут переходить на первую. Подробно об этой гипотезе можно почитать на сайте одного из авторов. Там есть поясняющие анимированные рисунки.
Это объяснение также сталкивается с немалыми трудностями:
- Выше я указал, что вирусные однонитевые геномы также подчинены второму правилу, некоторые с хорошей точностью. Очевидно, что вариант инверсий неприменим к однонитевым геномам. Но тут нужно вспомнить о гипотезах происхождения вирусов. Считается, что некоторые из них произошли от транспозонов или других мобильных элементов клеточных организмов. Так как в них второе правило выполняется, то логично ожидать, что геном вируса также будет содержать его следы. Но, насколько мне известно, происхождение не всех вирусов связывают напрямую с клеточными организмами.
- Из математической модели инверсий следует, что количества комплементарных оснований асимптотически стремятся к среднему значению их первоначальных значений. Если в первичном геноме в одной нити было Na нуклеотидов A и Nt нуклеотидов T, то со временем их количества будут всё ближе подходить к значению (Na+Nt)/2. Здесь нужно вспомнить, что практически во всех геномах имеется свой перекос между AT- и GC-содержанием, т.е. между теми самыми первоначальными средними. Перекос этот, по всей видимости, оптимален для данного организма (о некоторых идеях на этот счет в другой раз). Приходится сделать вывод, что наряду с инверсиями происходили повсеместные точечные замены, которые под действием отбора привели к оптимальному распределению оснований. Но тогда становится непонятно, почему такие повсеместные мутации, приведя к огромному перекосу между AT- и GC-содержанием, сохранили высокую точность второго правила, в том числе для олигонуклеотидов. Впрочем, у самого автора указано, что число точечных мутаций мизерно по сравнению с длиной геномов. Но в таком случае непонятно, как возникли оптимальные перекосы.
- Если инверсия затрагивает кодирующий участок, у нее огромные шансы быть отсеянной отбором. Но в нынешних прокариотах кодирующие участки занимают около 90% генома, т.е. в таком геноме инверсия почти всегда затронет какой-либо ген. Можно предположить, что основное заселение этих геномов генами происходило уже после его “нашинковки” и установления второго правила. Но здесь нужно учесть еще один интересный факт: частоты встречаемости олигонуклеотидов почти одинаковы в любых достаточно длинных ( ~ 1/20 часть хромосомы и более) участках генома. В начале страницы приведено распределение динуклеотидов в 10-й хромосоме человека. Примерно тот же профиль будет иметь любой достаточно длинный участок любой хромосомы Homo Sapiens. Соответственно, профиль всего генома будет тоже таким же. Профиль дрозофилы будет другим, но он будет один и тот же для всех ее хромосом и их отдельных участков (была даже идея рассматривать эти профили как “геномную подпись” организмов). Поэтому, если инверсии и были, то они всегда должны были сопровождаться транспозицией (инвертированный участок встраивается где-нибудь в другом месте). Полная нашинковка генома должна была сопровождаться полным его перемешиванием. Такая тотальная мясорубка не укладывается в голове, а уж тем более то, как при ней могли появляться кодирующие гены. Разве что после? Придется гадать, какие преимущества дает организму геном, который только и делает, что шинкует себя.
4. Последняя из известных мне гипотез появилась два года назад (Zhang & Huang, 2008). Cтатья написана на китайском английском и по-китайски обстоятельна - Жанг и Хуанг не поленились даже расписать в ней названия четырехсот проанализированных бактерий, почти на 4 страницы, через запятую.
Если гипотеза инверсий утверждает, что второе правило выточилось в течение эволюции в геномах, изначально имевших произвольные распределения оснований, то китайская гипотеза гласит прямо противоположное – второе правило является пережитком первых геномов, а инверсии в лучшем случае поддерживают его от разрушения. Первичные геномы, по мнению авторов, состояли из повторяющихся элементов, причем число прямых и обратных (комплементарных) повторов было примерно одинаково, что и являлось причиной второго правила.
Претензия к этой гипотезе та же самая, что и к шпилькам и дуплицированным инверсиям: поиск в геномах (с поправкой на допустимую степень совпадений) показывает, что комплементарные копии не настолько вездесущи, чтобы объяснить высокую точность второго правила. Ну да, геномы могли с того времени так исказиться точечными мутациями, что сейчас от копий почти ничего и не осталось. Но почему эти мутации не нарушили точность второго правила?
Такие вот геномные пироги.
UPD:
Основное обсуждение в коммюнити ru_genetics.
Оригинал поста