Наследие Чаргаффа, или Необычное свойство обычных геномов (часть 1)
Все помнят со школы двойную спираль ДНК, где две цепочки соединены правилом комплементарности: T против A, G против C. Меньшее число людей знают, что основанием для этого правила послужило другое, эмпирическое правило - “правило Чаргаффа”. И уж совсем мало кто знает о так называемом "втором правиле Чаргаффа" - интересном и до сих пор необъясненном свойстве геномов, хотя известно оно уже более десятка лет. Об этом феномене я и хочу здесь поведать.
Частичные признаки этого феномена первым обнаружил тот же Чаргафф, еще в 1968 году, что и дало основание называть его вторым правилом Чаргаффа. Особого интереса эти частичные результаты тогда не вызвали. Но лет 10 назад выяснилось, что его находка является следствием более общего правила – симметрии нитей ДНК по олигонуклеотидному составу. Тут и появились вопросы - как и зачем.
По этой теме было опубликовано всего около двух десятков статей, преимущественно в период 2002-2009 гг. Было предложено несколько гипотез, но все они неубедительны. Короче говоря, вопрос открыт.
В статьях можно найти такие эпитеты, как "astonishing", "enigmatic", "uncanny", столь нехарактерные для современных научных публикаций. Являясь действительно самой удивительной и к тому же универсальной особенностью всех геномов – от вирусных до хомосапиенсных, - это правило по неведомой мне причине до сих пор остается почти неизвестным даже среди генетиков. В рунете оно упоминалось лишь единожды на форуме paleo.ru и эхом на molbiol.ru (причем в последнем случае обсуждение заглохло после чьего-то высказывания о тривиальности этого правила – мол, это следствие статистики длинных последовательностей; человек был явно не в курсе обо всём феномене, который отнюдь не тривиален).
Неудивительно поэтому, что это правило я случайно открыл сам in silico, а позже узнал, что оно уже все-таки известно :) Теперь по порядку.
В 1950-1952 гг. Эрвин Чаргафф с сотрудниками проводил хроматографические исследования ДНК (уже было известно, что в состав ДНК входят четыре типа нуклеотида, но о спирали еще не догадывались). Результатом исследований стало первое правило Чаргаффа, которое просто и кратко можно сформулировать так: в молекулах ДНК количество тимина (T) равно количеству аденина (A), а количество гуанина (G) равно количеству цитозина (C). Если такая простая формулировка вас не устраивает, то формулировку замудрённее можете почитать на вики. Главное не запутаться – бывает, вторым правилом Чаргаффа, о котором пойдет речь далее, называют зачем-то второй пункт первого правила.
Иногда можно встретить заявление, что сущность правила Чаргаффа была объяснена в модели Уотсона и Крика. Но вернее сказать так: это правило явилось одним из ключевых результатов, на который опирались Уотсон и Крик при построении своей модели. Таким образом, если T и A, также как C и G, в целой молекуле ДНК идут всегда парами, то, разумеется, их количества будут одинаковы. Модель Уотсона-Крика прошла все испытания, и правило Чаргаффа действительно быстро нашло свое объяснение. Очевидным исключением из него является ДНК тех вирусов, у которых она имеет только одну нить (другие организмы с однонитевым геномом науке неизвестны).
Нобелевку за открытие структуры ДНК получили Крик, Уотсон и Уилкинс. По правилам комитета, премия в одной категории выдается не более чем трем исследователям, и только при жизни. Поэтому несколько людей, внесших большой вклад в открытие структуры ДНК, остались за бортом. В том числе Чаргафф. Это явилось одним из темных пунктов в истории нобелирования. Я не знаю, насколько это обескуражило самого Чаргаффа, но первых “двух клоунов”, по его же выражению, он недолюбливал всегда. А как еще может относиться “последний из вымершей породы естествоиспытателей” к двум фантазерам, строившим модель ДНК из шариков, проволоки и фигурок, вырезанных из картона? К тому же один из них был несостоявшимся физиком, а второй – почти птицеловом :)
Занимательный отрывок из очерка Чаргаффа “Building the Tower of Babble” (1977):
«Две недели спустя,— пишет Уотсон в своей книге “Двойная спираль”,— мы с Чаргаффом скользнули взглядом друг по другу в Париже, на Международном биохимическом конгрессе. Мы встретились во дворе Сорбонны, и только едва заметная сардоническая усмешка показала, что Чаргафф меня узнал».
Поскольку у меня в памяти удерживаются, к сожалению, лишь всякие пустяки, я действительно припоминаю встречу на биохимическом конгрессе 1952 года и неуклюжего молодого человека. Правда, мое настроение в тот момент вряд ли можно было назвать сардоническим: просто я разыскивал уборную, но какую бы дверь ни открывал, обязательно оказывался в какой-нибудь аудитории, всякий раз украшенной одним и тем же большим портретом кардинала Ришелье.
Когда в «Двойной спирали» заходит речь обо мне, то автор обычно употребляет эпитеты «саркастический» или «сардонический». На самом же деле после первой встречи в Кембридже с этой парой энтузиастов ко мне больше подошло бы определение «озадаченный»: я действительно был озадачен при виде двух человек, которые пытаются уложить нуклеотиды в спираль и рассуждают о ее шаге (двойной эта спираль стала, кажется, только после того, как я рассказал им о наших результатах), не потрудившись узнать строение соединений, из которых эта спираль должна состоять. Ужас, в который привела меня такая безграничная отвага, поймет лишь тот, кто припомнит, что в то время молекулярной биологии еще не существовало. Это сейчас в науке принято считать, что выходить за пределы своей специальности и своей компетенции полезно, и многим удается проглотить больше, чем они откусили. А тогдашнее мое отношение к этой затее правильнее было бы назвать «лаконическим», потому что, уезжая из Кембриджа, я записал для памяти: «Два бродячих торговца в поисках спирали».
Спустя 16 лет после обнаружения первого правила, Чаргаффу удалось разделить ДНК бактерии Bacillus Subtilis на две цепи и проанализировать нуклеотидный состав на этот раз уже не целой молекулы ДНК, а ее отдельных нитей.
Суть второго правила Чаргаффа так же проста, как и первого. Собственно, второе правило и представляет собой первое правило, только в применении к единичной цепи ДНК. То есть оно гласит, что в отдельной цепи ДНК количество A ≈ количеству T, количество G ≈ количеству C.
На самом деле в таком виде правило было сформулировано (и так названо) намного позже опытов Чаргаффа. Из его работы следует только то, что внутри одной цепи ДНК сумма A + C равна сумме T + G. Кроме того, у него речь идет о ДНК конкретной бактерии. Первые публикации, обращающие внимание на феномен в вышеуказанном определении, появились лишь в 90-х годах (Fickett et. al., 1992; Prabhu, 1993; Bell & Forsdyke, 1999), когда анализ проводился уже прямым подсчетом оснований в секвенированных последовательностях, а не химически.
В отличие от первого правила, в котором числа комплеменатрных оснований в двойной спирали ДНК равны практически точно, равенства во втором правиле приближенные. Насколько эти равенства нарушены – зависит от длины анализируемого участка. Для целой хромосомы высших эукариот (типичная длина – десятки миллионов пар оснований) ошибка в равенствах A ≈ T, G ≈ C составляет обычно сотые доли процента, иногда еще меньше. Другими словами, в среднем одно основание из нескольких тысяч не имеет комплементарного напарника в той же цепи. Что касается меньших участков генома, то точность равенств почти стабильно держится на длинах до 70-100 тысяч пар оснований – независимо, кодирующие там области или нет, - а дальше начинает спадать. На длинах от десятков тысяч до одной тысячи правило еще держится, хотя уже с большой ошибкой, а на длинах в сотни пар оснований и меньше оно уже практически не наблюдается.
Как выяснилось, правило это универсальное. Ему подчинены геномы практически всех организмов – вирусов, бактерий, архей, эукариот. Исключениями из него явились лишь митохондриальные геномы – и то только позвоночных, геномы вирусов с однонитевой ДНК и геномы всех РНК-вирусов. Но я коснусь этого дела подробнее позже; бытующее мнение о нарушении второго правила Чаргаффа в этих геномах является поспешным.
Почему правило не тривиальное? Ведь если сгенерировать длинную случайную последовательность из четырех оснований, то в ней в силу статистики будет всегда примерно A ≈ T, G ≈ C. Да, но в ней также всегда будет A ≈ C, G ≈ T и A ≈ G, T ≈ C. То есть в чисто случайной последовательности количества всех четырех нуклеотидов будут примерно равны. Но в реальных геномах не так. Там обычно либо так:
либо так:
Геномы с почти равным распределением оснований – как в случайной последовательности - крайне редки. Забавно, что именно такой нетипичный геном имеет самый распространенный модельный организм – кишечная палочка:
Почему у одних организмов %CG выше %AT, а у других наоборот – расскажу как-нибудь отдельной темой.
Если бы речь шла о геноме только высших эукариот, например, человека, второе правило было бы менее удивительным (хотя ненамного). Так как кодирующая область занимает у нас около 1,5% от всего генома, то проявление правила можно было бы как-то списать на остальную часть. Но в геномах бактерий и архей кодирующая область занимает 80-95% от всего генома. И, тем не менее, кодирующий текст упрямо удовлетворяет дополнительному условию – второму правилу Чаргаффа, никак не связанному (по крайней мере, на первый взгляд) с тем, какие белки этим текстом кодируются.
Приведу не совсем адекватную, но позволяющую почувствовать суть аналогию. Вам нужно написать осмысленный текст - сочинение страниц на 10, - но так, чтобы во всем тексте количество букв “а” равнялось количеству букв “б”, количество “в” равнялось количеству “г” и т.п.
Но и это покажется пустяком, если учесть, что второе правило Чаргаффа – частный случай более общего правила – симметрии цепочек ДНК по олигонуклеотидному составу.
Олигонуклеотид – любая небольшая последовательность оснований. Например: AGTTCAC, CA, GAT, СССССС. Один нуклеотид – частный случай олигонуклеотида с длиной единица, поэтому он называется еще мононуклеотидом. Если оснований два – динуклеотидом, три – тринуклеотидом, и т.п. А в общем случае – олигонуклеотидом.
У каждого олигонуклеотида есть комплементарный напарник. В случае мононуклеотидов все просто – это пары A и T, C и G. Будет ли комплементарным напарником для динуклеотида AC динуклеотид TG? Нет. Дело в том, что у цепочек ДНК (и РНК) есть выделенное направление чтения – от 5' к 3'. Процессы транскрипции и репликации ДНК, а также трансляции РНК всегда идут в этом направлении. Это правило одностороннего считывания соблюдается в клетках настолько строго, что им приходится жертвовать простотой процесса репликации. Было бы проще, если бы нити ДНК реплицировались в одну сторону непрерывно. Но нет – в двух цепочках направления чтения противоположны, и правило 5' -> 3' позволяет непрерывно реплицироваться только одной нити, в то время как другая реплицируется в обратном направлении кусками, которые потом сшиваются.
Итак, у двух цепей в ДНК направления чтения противоположны. Рассмотрим такой участок ДНК:
Верхняя цепь читается слева направо, нижняя – наоборот. Если в верхней цепи выделить тринуклеотид ATC (красный цвет), то в том же месте на второй цепи будет GAT, с учетом направления чтения. То есть, чтобы получить олигонуклеотид, комплементарный заданному, нужно не просто преобразовать его по правилу A <=> T, G <=> C, но еще и развернуть в обратном порядке. Обратите внимание, что олигонуклеотиды с четной длиной могут быть самокомплементарными. В случае динуклеотидов их четыре – AT, TA, GC, CG. На приведенном выше примере зеленым цветом выделен динуклеотид CG – видно, что он повторяет себя в обеих цепях.
Продолжение здесь.
Частичные признаки этого феномена первым обнаружил тот же Чаргафф, еще в 1968 году, что и дало основание называть его вторым правилом Чаргаффа. Особого интереса эти частичные результаты тогда не вызвали. Но лет 10 назад выяснилось, что его находка является следствием более общего правила – симметрии нитей ДНК по олигонуклеотидному составу. Тут и появились вопросы - как и зачем.
По этой теме было опубликовано всего около двух десятков статей, преимущественно в период 2002-2009 гг. Было предложено несколько гипотез, но все они неубедительны. Короче говоря, вопрос открыт.
В статьях можно найти такие эпитеты, как "astonishing", "enigmatic", "uncanny", столь нехарактерные для современных научных публикаций. Являясь действительно самой удивительной и к тому же универсальной особенностью всех геномов – от вирусных до хомосапиенсных, - это правило по неведомой мне причине до сих пор остается почти неизвестным даже среди генетиков. В рунете оно упоминалось лишь единожды на форуме paleo.ru и эхом на molbiol.ru (причем в последнем случае обсуждение заглохло после чьего-то высказывания о тривиальности этого правила – мол, это следствие статистики длинных последовательностей; человек был явно не в курсе обо всём феномене, который отнюдь не тривиален).
Неудивительно поэтому, что это правило я случайно открыл сам in silico, а позже узнал, что оно уже все-таки известно :) Теперь по порядку.
Первое правило Чаргаффа
В 1950-1952 гг. Эрвин Чаргафф с сотрудниками проводил хроматографические исследования ДНК (уже было известно, что в состав ДНК входят четыре типа нуклеотида, но о спирали еще не догадывались). Результатом исследований стало первое правило Чаргаффа, которое просто и кратко можно сформулировать так: в молекулах ДНК количество тимина (T) равно количеству аденина (A), а количество гуанина (G) равно количеству цитозина (C). Если такая простая формулировка вас не устраивает, то формулировку замудрённее можете почитать на вики. Главное не запутаться – бывает, вторым правилом Чаргаффа, о котором пойдет речь далее, называют зачем-то второй пункт первого правила.
Иногда можно встретить заявление, что сущность правила Чаргаффа была объяснена в модели Уотсона и Крика. Но вернее сказать так: это правило явилось одним из ключевых результатов, на который опирались Уотсон и Крик при построении своей модели. Таким образом, если T и A, также как C и G, в целой молекуле ДНК идут всегда парами, то, разумеется, их количества будут одинаковы. Модель Уотсона-Крика прошла все испытания, и правило Чаргаффа действительно быстро нашло свое объяснение. Очевидным исключением из него является ДНК тех вирусов, у которых она имеет только одну нить (другие организмы с однонитевым геномом науке неизвестны).
Лирическое отступление (читать необязательно)
| Эрвин Чаргафф |
Занимательный отрывок из очерка Чаргаффа “Building the Tower of Babble” (1977):
«Две недели спустя,— пишет Уотсон в своей книге “Двойная спираль”,— мы с Чаргаффом скользнули взглядом друг по другу в Париже, на Международном биохимическом конгрессе. Мы встретились во дворе Сорбонны, и только едва заметная сардоническая усмешка показала, что Чаргафф меня узнал».
Поскольку у меня в памяти удерживаются, к сожалению, лишь всякие пустяки, я действительно припоминаю встречу на биохимическом конгрессе 1952 года и неуклюжего молодого человека. Правда, мое настроение в тот момент вряд ли можно было назвать сардоническим: просто я разыскивал уборную, но какую бы дверь ни открывал, обязательно оказывался в какой-нибудь аудитории, всякий раз украшенной одним и тем же большим портретом кардинала Ришелье.
Когда в «Двойной спирали» заходит речь обо мне, то автор обычно употребляет эпитеты «саркастический» или «сардонический». На самом же деле после первой встречи в Кембридже с этой парой энтузиастов ко мне больше подошло бы определение «озадаченный»: я действительно был озадачен при виде двух человек, которые пытаются уложить нуклеотиды в спираль и рассуждают о ее шаге (двойной эта спираль стала, кажется, только после того, как я рассказал им о наших результатах), не потрудившись узнать строение соединений, из которых эта спираль должна состоять. Ужас, в который привела меня такая безграничная отвага, поймет лишь тот, кто припомнит, что в то время молекулярной биологии еще не существовало. Это сейчас в науке принято считать, что выходить за пределы своей специальности и своей компетенции полезно, и многим удается проглотить больше, чем они откусили. А тогдашнее мое отношение к этой затее правильнее было бы назвать «лаконическим», потому что, уезжая из Кембриджа, я записал для памяти: «Два бродячих торговца в поисках спирали».
Второе правило Чаргаффа
Спустя 16 лет после обнаружения первого правила, Чаргаффу удалось разделить ДНК бактерии Bacillus Subtilis на две цепи и проанализировать нуклеотидный состав на этот раз уже не целой молекулы ДНК, а ее отдельных нитей.
Суть второго правила Чаргаффа так же проста, как и первого. Собственно, второе правило и представляет собой первое правило, только в применении к единичной цепи ДНК. То есть оно гласит, что в отдельной цепи ДНК количество A ≈ количеству T, количество G ≈ количеству C.
На самом деле в таком виде правило было сформулировано (и так названо) намного позже опытов Чаргаффа. Из его работы следует только то, что внутри одной цепи ДНК сумма A + C равна сумме T + G. Кроме того, у него речь идет о ДНК конкретной бактерии. Первые публикации, обращающие внимание на феномен в вышеуказанном определении, появились лишь в 90-х годах (Fickett et. al., 1992; Prabhu, 1993; Bell & Forsdyke, 1999), когда анализ проводился уже прямым подсчетом оснований в секвенированных последовательностях, а не химически.
В отличие от первого правила, в котором числа комплеменатрных оснований в двойной спирали ДНК равны практически точно, равенства во втором правиле приближенные. Насколько эти равенства нарушены – зависит от длины анализируемого участка. Для целой хромосомы высших эукариот (типичная длина – десятки миллионов пар оснований) ошибка в равенствах A ≈ T, G ≈ C составляет обычно сотые доли процента, иногда еще меньше. Другими словами, в среднем одно основание из нескольких тысяч не имеет комплементарного напарника в той же цепи. Что касается меньших участков генома, то точность равенств почти стабильно держится на длинах до 70-100 тысяч пар оснований – независимо, кодирующие там области или нет, - а дальше начинает спадать. На длинах от десятков тысяч до одной тысячи правило еще держится, хотя уже с большой ошибкой, а на длинах в сотни пар оснований и меньше оно уже практически не наблюдается.
Как выяснилось, правило это универсальное. Ему подчинены геномы практически всех организмов – вирусов, бактерий, архей, эукариот. Исключениями из него явились лишь митохондриальные геномы – и то только позвоночных, геномы вирусов с однонитевой ДНК и геномы всех РНК-вирусов. Но я коснусь этого дела подробнее позже; бытующее мнение о нарушении второго правила Чаргаффа в этих геномах является поспешным.
Почему правило не тривиальное? Ведь если сгенерировать длинную случайную последовательность из четырех оснований, то в ней в силу статистики будет всегда примерно A ≈ T, G ≈ C. Да, но в ней также всегда будет A ≈ C, G ≈ T и A ≈ G, T ≈ C. То есть в чисто случайной последовательности количества всех четырех нуклеотидов будут примерно равны. Но в реальных геномах не так. Там обычно либо так:
либо так:
Геномы с почти равным распределением оснований – как в случайной последовательности - крайне редки. Забавно, что именно такой нетипичный геном имеет самый распространенный модельный организм – кишечная палочка:
Почему у одних организмов %CG выше %AT, а у других наоборот – расскажу как-нибудь отдельной темой.
Если бы речь шла о геноме только высших эукариот, например, человека, второе правило было бы менее удивительным (хотя ненамного). Так как кодирующая область занимает у нас около 1,5% от всего генома, то проявление правила можно было бы как-то списать на остальную часть. Но в геномах бактерий и архей кодирующая область занимает 80-95% от всего генома. И, тем не менее, кодирующий текст упрямо удовлетворяет дополнительному условию – второму правилу Чаргаффа, никак не связанному (по крайней мере, на первый взгляд) с тем, какие белки этим текстом кодируются.
Приведу не совсем адекватную, но позволяющую почувствовать суть аналогию. Вам нужно написать осмысленный текст - сочинение страниц на 10, - но так, чтобы во всем тексте количество букв “а” равнялось количеству букв “б”, количество “в” равнялось количеству “г” и т.п.
Но и это покажется пустяком, если учесть, что второе правило Чаргаффа – частный случай более общего правила – симметрии цепочек ДНК по олигонуклеотидному составу.
Технико-лирическое отступление (для чайников)
Олигонуклеотид – любая небольшая последовательность оснований. Например: AGTTCAC, CA, GAT, СССССС. Один нуклеотид – частный случай олигонуклеотида с длиной единица, поэтому он называется еще мононуклеотидом. Если оснований два – динуклеотидом, три – тринуклеотидом, и т.п. А в общем случае – олигонуклеотидом.
У каждого олигонуклеотида есть комплементарный напарник. В случае мононуклеотидов все просто – это пары A и T, C и G. Будет ли комплементарным напарником для динуклеотида AC динуклеотид TG? Нет. Дело в том, что у цепочек ДНК (и РНК) есть выделенное направление чтения – от 5' к 3'. Процессы транскрипции и репликации ДНК, а также трансляции РНК всегда идут в этом направлении. Это правило одностороннего считывания соблюдается в клетках настолько строго, что им приходится жертвовать простотой процесса репликации. Было бы проще, если бы нити ДНК реплицировались в одну сторону непрерывно. Но нет – в двух цепочках направления чтения противоположны, и правило 5' -> 3' позволяет непрерывно реплицироваться только одной нити, в то время как другая реплицируется в обратном направлении кусками, которые потом сшиваются.
Итак, у двух цепей в ДНК направления чтения противоположны. Рассмотрим такой участок ДНК:
5' => ATCTGACG => 3'
3' <= TAGACTGC <= 5'
3' <= TAGACTGC <= 5'
Верхняя цепь читается слева направо, нижняя – наоборот. Если в верхней цепи выделить тринуклеотид ATC (красный цвет), то в том же месте на второй цепи будет GAT, с учетом направления чтения. То есть, чтобы получить олигонуклеотид, комплементарный заданному, нужно не просто преобразовать его по правилу A <=> T, G <=> C, но еще и развернуть в обратном порядке. Обратите внимание, что олигонуклеотиды с четной длиной могут быть самокомплементарными. В случае динуклеотидов их четыре – AT, TA, GC, CG. На приведенном выше примере зеленым цветом выделен динуклеотид CG – видно, что он повторяет себя в обеих цепях.
Продолжение здесь.
Оригинал поста