Как изобретали генетический код
Две волны - две нити ДНК. Синими линиями обозначены связи между комплементарными нуклеотидами (на гамовских ромбиках это горизонтальные диагонали). У Гамова на рисунке еще нет общепринятых обозначений, нуклеотиды обозначаются цифрами ( 1 = A, 2 = T, 3 = G, 4 = C).
Казалось бы, много ума не надо, чтобы предложить подобную модель, где каждая аминокислота входит в свою дырку. Но изюминка здесь в том, что она объясняет загадочное число 20. Из картинки Гамова видно, что число различных ромбовых комбинаций именно в такой модели равно как раз двадцати. Причем 8 из них (верхние два ряда) – простые, т.к. и сверху, и снизу – одно и то же основание. Остальные 12 имеют по две стереохимические конфигурации, в зависимости от того, какое основание вверху, какое внизу.
Бубновый код Гамова является перекрывающимся. Это значит, что каждый нуклеотид (либо, в данном случае, его комплементарный напарник) входит сразу в три разных кодона. Например, последовательность TTCATCG дает следующие кодоны: TTC – TCA – CAT – ATC – TCG. Последние две буквы каждого триплета являются первыми двумя буквами следующего (за исключением первого и последнего). Совершенно ясно, что такой код налагает жесткие ограничения на возможные последовательности аминокислот. В лучшем случае, за данной аминокислотой может стоять одна из четырех разрешенных кодом, а не любая из двадцати. Другими словами – между аминокислотами должна существовать частичная корреляция, что и отметил Гамов в своей заметке.
Однако накапливающиеся данные говорили о том, что между аминокислотами в белках нет корреляции, по крайней мере, такой жесткой, которая следовала из бубнового кода.
Использованные материалы:
Lily E. Kay - "Who wrote the book of life?: a history of the genetic code"
American Scientist - The Invention of the Genetic Code
Оригинальные публикации
Сразу после открытия структуры ДНК и до момента расшифровки генетического кода предпринималось немало попыток предсказать этот код теоретически. В основном то были участники “РНК-галстучного клуба”, наполовину состоящего из теоретиков. Некоторые модели были настолько изящными и остроумными, что когда код был “взломан” напрямую без мудрствований биохимиками, и оказался как будто бы случайным набором соответствий триплет-аминокислота, среди теоретиков появилось некоторое разочарование – слишком просто выглядел реальный код по сравнению с их изысками. Модель Крика “code without commas” вообще можно назвать самой гениальной из несостоявшихся научных гипотез 20 века.
| Джордж Гамов |
Наиболее удивительным в этой истории является то, что чисто стереохимическая проблема – как последовательность нуклеотидов в ДНК организует последовательность аминокислот в белках – на семь лет превратилась в совершенно абстрактную семантическую задачу. О химии просто забыли. Самая первая модель – “бубновый код” Гамова - еще как-то контачит со стереохимией. Большинство последующих моделей основано уже на символьной логике. В первом предложении статьи Крика так и написано: “В этой работе рассматривается математическая проблема, возникшая в связи с синтезом белков”. Примечательно, что тогда такой подход не считался фричеством, хотя происходило это всего полвека назад.
Итак, перенесемся мысленно в то время. Только что стало известно, что ДНК – это двойная спираль, комплементарные нити которой состоят из звеньев-нуклеотидов четырех типов. Но пока еще не было прочитано ни единого кусочка ДНК-вого четырехбуквенного текста. С белками ситуация была немного лучше – Сенгер в то время заканчивал секвенирование инсулина, также были известны небольшие последовательности аминокислот других белков. Уже знали, что в состав белков, исследованных на тот момент, входят только 20 определенных аминокислот. О молекулярном аппарате трансляции, в том числе об мРНК и тРНК, ничего известно не было (знали только, что в клетках зачем-то есть достаточно много молекул РНК). Рибосомы в микроскоп уже наблюдали, но об их функциях тоже не знали. Наконец, было известно, что 20-буквенный текст белков как-то закодирован в 4-буквенном тексте ДНК. Вопрос состоял в том, КАК закодирован.
Гамовские бубны (Gamow's diamonds)
| Оригинальный рисунок из публикации Гамова |
Февраль, 1954 год. В журнале Nature появляется заметка на полстраницы под названием “Возможная связь между структурами ДНК и белков”. Автор – Джордж Гамов, он же Георгий, он же Аланин, бывший одессит, а теперь гражданин США, уже успевший создать теорию альфа-распада и первую модель “горячей Вселенной”, а также предсказать существование реликтового излучения. Теперь его пророчества обратились на поприще генетики.
Его идея заключалась в том, что сборка белков происходит непосредственно на молекуле ДНК. Между двумя нитями в спирали ДНК находятся ромбовидные “дырки”, точная конфигурация которых определяется комбинацией окружающих их нуклеотидов. Каждой аминокислоте соответствует своя дырка. Если в дырку своей боковой цепью попала правильная аминокислота (“ключ” подошел к “замку”), то она там остается, и когда заполнятся все дырки, по аминокислотам останется проехать специальным ферментом, как утюгом, и сполимеризовать белок.
Эта модель является триплетной (дублетные коды не рассматривались, так как количество возможных дублетов – 16 – мало для кодирования всех известных аминокислот). Хотя каждая дырка ограничена четырьмя нуклеотидами, два из них всегда комплементарны, поэтому “значащими” являются только три нуклеотида. Оригинальный рисунок Гамова немного запутан, поэтому поясняю своим рисунком:
Его идея заключалась в том, что сборка белков происходит непосредственно на молекуле ДНК. Между двумя нитями в спирали ДНК находятся ромбовидные “дырки”, точная конфигурация которых определяется комбинацией окружающих их нуклеотидов. Каждой аминокислоте соответствует своя дырка. Если в дырку своей боковой цепью попала правильная аминокислота (“ключ” подошел к “замку”), то она там остается, и когда заполнятся все дырки, по аминокислотам останется проехать специальным ферментом, как утюгом, и сполимеризовать белок.
Эта модель является триплетной (дублетные коды не рассматривались, так как количество возможных дублетов – 16 – мало для кодирования всех известных аминокислот). Хотя каждая дырка ограничена четырьмя нуклеотидами, два из них всегда комплементарны, поэтому “значащими” являются только три нуклеотида. Оригинальный рисунок Гамова немного запутан, поэтому поясняю своим рисунком:
Казалось бы, много ума не надо, чтобы предложить подобную модель, где каждая аминокислота входит в свою дырку. Но изюминка здесь в том, что она объясняет загадочное число 20. Из картинки Гамова видно, что число различных ромбовых комбинаций именно в такой модели равно как раз двадцати. Причем 8 из них (верхние два ряда) – простые, т.к. и сверху, и снизу – одно и то же основание. Остальные 12 имеют по две стереохимические конфигурации, в зависимости от того, какое основание вверху, какое внизу.
Бубновый код Гамова является перекрывающимся. Это значит, что каждый нуклеотид (либо, в данном случае, его комплементарный напарник) входит сразу в три разных кодона. Например, последовательность TTCATCG дает следующие кодоны: TTC – TCA – CAT – ATC – TCG. Последние две буквы каждого триплета являются первыми двумя буквами следующего (за исключением первого и последнего). Совершенно ясно, что такой код налагает жесткие ограничения на возможные последовательности аминокислот. В лучшем случае, за данной аминокислотой может стоять одна из четырех разрешенных кодом, а не любая из двадцати. Другими словами – между аминокислотами должна существовать частичная корреляция, что и отметил Гамов в своей заметке.
Однако накапливающиеся данные говорили о том, что между аминокислотами в белках нет корреляции, по крайней мере, такой жесткой, которая следовала из бубнового кода.
Комбинаторный код
Гамов не сдавался. Позже он предложил другую модель генетического кода – “треугольный код”, тоже перекрывающийся, но с меньшими ограничениями. В нем все 64 триплета рассортировывались также в 20 групп. Вскоре у него появилась третья модель, еще более простая, и уже совсем абстрагированная от стереохимии. В ней значение триплета определялось исключительно его составом независимо от того, в какой последовательности расположены три нуклеотида. Из простой комбинаторики ясно, что и в этом случае все кодоны, распадаясь на три семейства, дают 20 групп (это число сочетаний с повторениями любых четырех объектов по три). Каждая группа отвечает одной аминокислоте.
| Все три основания одинаковые | Все три основания разные | Два из трех оснований одинаковы |
| 1) TTT 2) AAA 3) CCC 4) GGG | 5) C,A,T (CAT, TCA, ATC, ACT, TAC, CTA) 6) C,T,G (GCT, CTG, TGC, TCG, GTC, CGT) 7) G,A,T (TGA, GAT, ATG, AGT, TAG, GTA) 8) A,G,C (CAG, AGC, GCA, GAC, CGA, ACG) | 9) T,T,C (TTC, CTT, TCT) 10) T,T,A (TTA, ATT, TAT) 11) T,T,G (TTG, GTT, TGT) 12) C,C,T (CCT, TCC, CTC) 13) C,C,A (CCA, ACC, CAC) 14) C,C,G (CCG, GCC, CGC) 15) A,A,T (AAT, TAA, ATA) 16) A,A,C (AAC, CAA, ACA) 17) A,A,G (AAG, GAA, AGA) 18) G,G,T (GGT, TGG, GTG) 19) G,G,C (GGC, CGG, GCG) 20) G,G,A (GGA, AGG, GAG) |
Итого, 20 групп => 20 аминокислот.
Этот код был также перекрывающимся. Неперекрывающиеся коды вначале не рассматривались по той причине, что пугала неоднозначность в считывании кодонов. С рассмотренными кодами все понятно – считывание происходит всегда со сдвигом на одно основание. Но как быть там? Последовательность аминокислот будет зависеть не только от последовательности нуклеотидов в ДНК, но и от того, в какой рамке ее считывать. Например, участок TGGACTTGCA читается как три разные последовательности кодонов, в зависимости от того, где начинать считывание:
1) TGG – ACT – TGC – A…
2) …T – GGA – CTT – GCA
3) …TG – GAC – TTG – CA…
Какой вариант правильный?
Но накапливающиеся факты все сильнее указывали на то, что реальный код все-таки неперекрывающийся. Это было видно, например, по мутациям. Если в кодирующей последовательности ДНК заменяется одно основание, то в случае перекрывающегося кода в белке должны измениться три соседних аминокислоты. Но опыт показывал, что заменялась только одна. Еще немного позже точный анализ белковых последовательностей выявил, что между аминокислотами корреляции практически никакой нет. Настал период моделей неперекрывающегося кода.
Этот код был также перекрывающимся. Неперекрывающиеся коды вначале не рассматривались по той причине, что пугала неоднозначность в считывании кодонов. С рассмотренными кодами все понятно – считывание происходит всегда со сдвигом на одно основание. Но как быть там? Последовательность аминокислот будет зависеть не только от последовательности нуклеотидов в ДНК, но и от того, в какой рамке ее считывать. Например, участок TGGACTTGCA читается как три разные последовательности кодонов, в зависимости от того, где начинать считывание:
1) TGG – ACT – TGC – A…
2) …T – GGA – CTT – GCA
3) …TG – GAC – TTG – CA…
Какой вариант правильный?
Но накапливающиеся факты все сильнее указывали на то, что реальный код все-таки неперекрывающийся. Это было видно, например, по мутациям. Если в кодирующей последовательности ДНК заменяется одно основание, то в случае перекрывающегося кода в белке должны измениться три соседних аминокислоты. Но опыт показывал, что заменялась только одна. Еще немного позже точный анализ белковых последовательностей выявил, что между аминокислотами корреляции практически никакой нет. Настал период моделей неперекрывающегося кода.
Код без запятых
Откуда такое название? Когда дело дошло до неперекрывающихся кодов, было непонятно, располагаются ли кодоны вплотную друг к другу, или же между ними могут быть незначащие основания (типа, “пробелы” или “запятые”). Модели первой категории именовались “comma-free codes”, второй – “codes with commas”. К первой категории и относится модель, которую предложил Крик, Оргел и Гриффит через три года после первой модели Гамова.
| Фрэнсис Крик |
К тому времени уже были веские основания считать, что синтез белков происходит не на ДНК, а на посреднике в виде молекулы РНК, которая копируется с ДНК (т.н. матричная РНК или мРНК). Кроме того, Крик уже развивал гипотезу об адаптерных молекулах, согласно которой аминокислоты не собираются непосредственно даже на мРНК, а взаимодействуют с ней через молекулу-адаптер (эта гипотеза позже подтвердилась, адаптерными молекулами оказались транспортные РНК, или тРНК). Адаптер с одного конца имеет антикодон, т.е. кодон, комплементарный кодону на мРНК, а с другого конца цепляет аминокислоту, соответствующую данному кодону. Сценарий синтеза белка казался тогда таким: с участка ДНК снимается копия в виде однонитевой цепочки мРНК (для копирования неважен смысл кодонов, поэтому тут заморочек нет), затем мРНК перемещается из ядра в цитоплазму. Там снуют адаптеры с уже правильно прицепленными аминокислотами. Если адаптер попадает антикодоном на кодон мРНК, и если они комплементарно сходятся, то адаптер вместе с аминокислотой прочно прилепляется к мРНК. Когда таким образом прилепятся все адаптеры, аминокислотам, торчащим с других концов, останется только образовать пептидные связи между собой – и белок готов.
Но здесь есть одна проблема – адаптер может прилепиться не в той рамке считывания. Скажем, на мРНК есть последовательность TACGTC, которая двумя кодонами – TAC и GTC кодирует две правильные в контексте данного белка аминокислоты. Но ведь адаптеры об этом не знают. И один из них, например, имеющий антикодон, соответствующий кодону ACG, может прилепиться посередине этой последовательности и нарушить синтез белка. Поэтому в неперекрывающейся последовательности триплетов для правильного синтеза белка адаптерам необходимо знать правильную рамку считывания.
Именно эту проблему и решает модель Крика, причем на уровне абстрактной логики. Модель настолько остроумна, что создавалось ощущение: по-другому быть просто не может. Авторы в конце оговариваются, что не испытывают большой уверенности в правоте модели, основанной на чисто теоретических умозаключениях, но наверняка Крик уже потирал ладони в предвкушении второй нобелевки (правда, первую на тот момент ему еще не дали). Модель в итоге оказалась неверной, но это самая изящная из всех неправильных гипотез в науке 20 века :)
Идея состояла в том, что не для всех 64-х кодонов существуют адаптерные молекулы. Другими словами – только часть кодонов являются значащими (кодируют аминокислоту). Остальная часть – незначащие кодоны, “пустышки”. Задача сводится к построению такого кода, чтобы любые два значащих кодона, помещенные рядом, давали в остальных двух рамках считывания незначащие кодоны. Например, если кодоны CGT и AAG – значащие, тогда кодоны GTA и TAA должны быть незначащими, т.к. они появляются внутри последовательности CGTAAG, составленной из первых двух кодонов (в мРНК вместо тимина стоит урацил, поэтому правильнее здесь вместо T использовать U, но это не суть важно). Если же соединить два первых кодона в другом порядке: AAGCGT, то найдем, что незначащими кодонами должны быть также AGC и GCG. В итоге, если все кодоны, находящиеся в неверной рамке считывания, незначащие, то неоднозначность в прочтении текста мРНК исчезает, даже если этот коднеимеетпробеловилидругихразделителей.
Но остался еще важный вопрос: а сколько в таком коде может остаться значащих кодонов? Нам-то нужно как минимум двадцать.
Крик со своей компанией (кстати, с Оргелом он фантазировал еще не раз; в 1981 году они вдвоем продвигали гипотезу намеренной панспермии) вывел, что наибольшее число значащих кодонов в таком коде равно как раз двадцати. Первым делом замечаем, что кодоны TTT, CCC, AAA и GGG должны быть незначащими, т.к. если поместить их рядом с собой, то в других рамках считывания получится опять тот же кодон. Оставшиеся 60 кодонов делятся на группы по три кодона в каждой, внутри групп кодоны связаны циклическим односторонним сдвигом оснований. Например, одна из групп будет такой: AGT, GTA, TAG. Для формирования кода, имеющего только одну значащую рамку считывания, из каждой такой группы нужно взять не более, чем один кодон. Количество всех групп равно 60/3 = 20 штук!
Но эта модель дает только максимально возможное число значащих кодонов. Однозначного решения с точным выявлением значащих кодонов она дать не может. Авторы приводят в статье несколько возможных вариантов.
Но здесь есть одна проблема – адаптер может прилепиться не в той рамке считывания. Скажем, на мРНК есть последовательность TACGTC, которая двумя кодонами – TAC и GTC кодирует две правильные в контексте данного белка аминокислоты. Но ведь адаптеры об этом не знают. И один из них, например, имеющий антикодон, соответствующий кодону ACG, может прилепиться посередине этой последовательности и нарушить синтез белка. Поэтому в неперекрывающейся последовательности триплетов для правильного синтеза белка адаптерам необходимо знать правильную рамку считывания.
Именно эту проблему и решает модель Крика, причем на уровне абстрактной логики. Модель настолько остроумна, что создавалось ощущение: по-другому быть просто не может. Авторы в конце оговариваются, что не испытывают большой уверенности в правоте модели, основанной на чисто теоретических умозаключениях, но наверняка Крик уже потирал ладони в предвкушении второй нобелевки (правда, первую на тот момент ему еще не дали). Модель в итоге оказалась неверной, но это самая изящная из всех неправильных гипотез в науке 20 века :)
Идея состояла в том, что не для всех 64-х кодонов существуют адаптерные молекулы. Другими словами – только часть кодонов являются значащими (кодируют аминокислоту). Остальная часть – незначащие кодоны, “пустышки”. Задача сводится к построению такого кода, чтобы любые два значащих кодона, помещенные рядом, давали в остальных двух рамках считывания незначащие кодоны. Например, если кодоны CGT и AAG – значащие, тогда кодоны GTA и TAA должны быть незначащими, т.к. они появляются внутри последовательности CGTAAG, составленной из первых двух кодонов (в мРНК вместо тимина стоит урацил, поэтому правильнее здесь вместо T использовать U, но это не суть важно). Если же соединить два первых кодона в другом порядке: AAGCGT, то найдем, что незначащими кодонами должны быть также AGC и GCG. В итоге, если все кодоны, находящиеся в неверной рамке считывания, незначащие, то неоднозначность в прочтении текста мРНК исчезает, даже если этот коднеимеетпробеловилидругихразделителей.
Но остался еще важный вопрос: а сколько в таком коде может остаться значащих кодонов? Нам-то нужно как минимум двадцать.
Крик со своей компанией (кстати, с Оргелом он фантазировал еще не раз; в 1981 году они вдвоем продвигали гипотезу намеренной панспермии) вывел, что наибольшее число значащих кодонов в таком коде равно как раз двадцати. Первым делом замечаем, что кодоны TTT, CCC, AAA и GGG должны быть незначащими, т.к. если поместить их рядом с собой, то в других рамках считывания получится опять тот же кодон. Оставшиеся 60 кодонов делятся на группы по три кодона в каждой, внутри групп кодоны связаны циклическим односторонним сдвигом оснований. Например, одна из групп будет такой: AGT, GTA, TAG. Для формирования кода, имеющего только одну значащую рамку считывания, из каждой такой группы нужно взять не более, чем один кодон. Количество всех групп равно 60/3 = 20 штук!
Но эта модель дает только максимально возможное число значащих кодонов. Однозначного решения с точным выявлением значащих кодонов она дать не может. Авторы приводят в статье несколько возможных вариантов.
Кроме описанных моделей было много других. В одной из них, например, A и C рассматривались как синонимы, T и G - тоже. То есть код был двоичным. Триплетов в таком коде уже не хватит для кодирования 20-ти аминокислот, поэтому вводили двоичные квинтуплеты, возможное число которых – 2 в пятой степени, т.е. 32.
Свой вариант кода был и у Фейнмана, который тоже был участником галстучного клуба.
Свой вариант кода был и у Фейнмана, который тоже был участником галстучного клуба.
Наверняка этих моделей было бы еще больше, если бы в 1961 году неожиданно не грянул гром: появилась новость, что химикам удалось-таки напрямую расшифровать один кодон. Маршалл Ниренберг на биохимическом конгрессе в Москве сообщил, что он и его сотрудник получили работающую систему трансляции в экстракте из кишечной палочки, и сумели подсунуть ей искусственную мРНК, составленную из одной буквы U (во-первых, такую мРНК легче всего было изготовить, во-вторых – плевать на рамку считывания). На выходе получилась пептидная цепь, составленная из одной аминокислоты – фенилаланина. Таким образом, стало ясно, что триплет UUU (т.е. TTT в ДНК) соответствует фенилаланину. В криковской же модели этот кодон должен был быть незначащим. В течение следующего года было расшифровано еще несколько кодонов, а к 1967 году расшифровка кода была полностью завершена.
Генетический код оказался не просто непохожим на теоретические модели. В то время как теоретики пытались объяснить, почему в нем используется только 20 аминокислот, в реальном коде как раз теоретически можно кодировать более двадцати букв :) А выбор правильной рамки считывания производится точным позиционированием рибосомы на мРНК и специальным стартовым кодоном.
Вначале, конечно, оговаривалось, что речь идет о коде конкретного организма – кишечной палочки E. coli. Но факты свидетельствовали, что код в других организмах, по-видимому, точно такой же. Хотя со временем и было найдено несколько вариаций кода E. coli (который стал называться универсальным). На данный момент известно почти два десятка вариаций, хотя все они отличаются от универсального кода очень незначительно, и встречаются в биосфере намного реже.
Lily E. Kay - "Who wrote the book of life?: a history of the genetic code"
American Scientist - The Invention of the Genetic Code
Оригинальные публикации
Оригинал