Что ДНК делает со своей формой
в области TSS CD55
Наши профили метилирования — одномерные: 137 CpG вдоль 6,4 kb. Но ДНК в этом окне не прямая линия. Она может складываться в G-квадруплексы, i-мотивы, Z-форму, R-петли, крестообразные структуры — и всё это укладывается в петли и домены хроматина. Эта страница — карта того, где такие структуры искать и как связать их с тем, что мы уже измерили.
1. Система координат
Всё на этой странице привязано к одному окну. Прежде чем накладывать структуру на метилирование, координаты должны совпадать до пары оснований — иначе «перекрытие» ничего не значит.
| Величина | Значение | Откуда |
|---|---|---|
| Окно анализа (GRCh38) | chr1:207,318,092–207,324,450 | Файл координат проекта |
| Длина окна | 6,358 bp | Вычислено: конец − начало |
| TSS (выведен, требует подтверждения) | ≈ chr1:207,321,620 | Вычислено из якоря: пик CpG #78–83 = chr1:207,321,678 = +58 bp |
| Окно относительно TSS | −3,528 … +2,830 | Вычислено. Сходится: MAZ/GATA1/NFE2 на ≈−3,4 kb попадают внутрь левого края |
| Число CpG | 137 | Файл координат проекта |
| Плотность CpG, всё окно | 2,15 / 100 bp | Вычислено: 137 / 6 358 |
| Значимый блок #20–132 (LOW vs HIGH) | −1,077 … +1,935 | Анализ K562 Day 16 |
| Плотность CpG в блоке | 3,75 / 100 bp (113 CpG / 3 012 bp) | Вычислено |
| Пик дифференциала #78–83 | +58 … +84 | Анализ K562 Day 16 |
| Плотность CpG в пике | 22,2 / 100 bp (6 CpG / 27 bp) | Вычислено — один CpG каждые 4,5 bp |
| Протоспейсер CRISPRoff (T-клетки) | +93 … +112 | Датасет T-клеток; пик заканчивается за 9 bp до него |
| Сайт связывания ZFP (K562 ZFPoff) | не задан | Нужен от нас — без него нельзя отделить структуру от следа эффектора |
2. Что уже нанесено на этот локус
Ниже — только измеренное: блок значимых CpG, пик дифференциала, ChIP-seq пики K562 и три литературных CACCC-сайта KLF4. Структурные треки лягут поверх этой же оси.
3. 2D: небиформная ДНК
Семь классов структур, которые могут возникать в промоторной области. Для каждого — последовательностная подпись, документированная связь с 5mC, чем считать и что это предсказывает для наших групп LOW / HIGH / BASE.
G-квадруплекс
G4 · G-quadruplex
- Подпись
- Четыре трека по ≥3 гуанинов с петлями 1–7 нт. Формируется на G-цепи; комплементарная C-цепь при этом остаётся одноцепочечной или сама сворачивается в i-мотив.
- Связь с 5mC
- Документированная и направленная: G4 ингибируют DNMT1 и локально удерживают гипометилирование; G4 обогащены в неметилированных CGI-промоторах (Mao et al. 2018).
- Чем считать
- G4Hunter (окно 25, порог 1,2), pqsfinder. Экспериментально: G4-seq и G4 ChIP-seq в K562 (Hänsel-Hertsch et al. 2016) — для нас это правильная клеточная линия.
- Что предсказывает у нас
- Если G4 перекрывает плотное ядро CpG, он может быть причиной, по которой BASE и LOW держатся на 7,4 % и 9,2 %. Тогда ZFPoff/CRISPRoff — это «продавливание» структурного барьера, а HIGH (29,4 %) — состояние, где барьер снят.
i-мотив
i-motif · C-rich counterpart
- Подпись
- C-богатая цепь, комплементарная G4-мотиву. Зависит от pH и отрицательной суперспирализации; в клетке существует, показан антителом iMab (Zeraati et al. 2018).
- Связь с 5mC
- Существует, но направление контекст-зависимо: 5mC сдвигает переходный pH и термостабильность i-мотива, и в литературе описаны сдвиги в обе стороны. Не принимать знак эффекта на веру — проверять для конкретной последовательности.
- Чем считать
- G4Hunter по обратно-комплементарной цепи (C-богатая сторона), затем сопоставить с G4-предсказаниями — они должны быть на одних координатах, на разных цепях.
- Что предсказывает у нас
- Асимметрию между цепями. Это самое ценное здесь: ONT читает каждую цепь отдельно, поэтому мы можем измерить метилирование по цепям прямо на имеющихся данных — новых экспериментов не нужно.
Z-ДНК
Z-DNA · левозакрученная форма
- Подпись
- Чередование пурин/пиримидин, прежде всего повторы (CG)n и (CA)n. Требует отрицательной суперспирализации — то есть возникает позади движущейся РНК-полимеразы.
- Связь с 5mC
- Самая сильная и самая старая из всех перечисленных: 5-метилцитозин резко стабилизирует Z-форму, снижая необходимую ионную силу на порядки (Behe & Felsenfeld 1981).
- Чем считать
- Z-Hunt (zhunt3), готовые треки Z-ДНК в Non-B DB для hg38.
- Что предсказывает у нас
- Единственный класс, где наше вмешательство — причина структуры, а не следствие. Если рядом со следом эффектора есть (CG)n, то HIGH может быть Z-склонным, а LOW — нет, и это следствие редактирования, а не исходное свойство локуса.
R-петля
R-loop · РНК:ДНК гибрид + вытесненная цепь
- Подпись
- GC-skew: избыток G на нематричной цепи ниже TSS. Ко-транскрипционная структура — без транскрипции не образуется.
- Связь с 5mC
- R-петли характерны именно для неметилированных CGI-промоторов и защищают их от de novo метилирования DNMT3B1 (Ginno et al. 2012).
- Чем считать
- QmRLFS-finder плюс GC-skew в скользящем окне 100 bp. Экспериментально — DRIP-seq / qDRIP.
- Что предсказывает у нас
- Обратную связь и, главное, порядок событий: замолкание → падение транскрипции → потеря R-петли → снятие защиты → распространение метилирования на фланги. Это предсказывает временную задержку — ядро метилируется раньше флангов. Проверяемо на серии Day 2 → 16 → 35.
Крестообразная структура
cruciform · инвертированные повторы
- Подпись
- Инвертированные повторы длиной ≥6 bp с коротким спейсером. Экструзия зависит от суперспирализации.
- Связь с 5mC
- Прямая связь документирована слабо. Есть общее соображение, что шпилечная ДНК — плохой субстрат для DNMT, но для этого локуса это гипотеза, а не установленный факт.
- Чем считать
- EMBOSS einverted; треки cruciform в Non-B DB.
- Что предсказывает у нас
- Кандидат на объяснение резких границ значимого блока. Почему сигнал начинается на CpG #20 и обрывается на #132, а не размывается плавно? Границы структурного элемента — одно из немногих объяснений резкого края.
H-ДНК / триплекс
H-DNA · внутримолекулярный триплекс
- Подпись
- Зеркальные пурин-богатые повторы (полипурин/полипиримидин).
- Связь с 5mC
- Слабая и плохо документированная. Основной эффект триплексов — блок элонгации Pol II, а не изменение метилирования.
- Чем считать
- Triplexator; треки H-DNA в Non-B DB.
- Что предсказывает у нас
- Низкий приоритет для механизма. Но проверить стоит по технической причине: триплексы и другие структуры дают обрывы ONT-ридов и ошибки картирования, а это уже влияло бы на наши покрытия и на фильтр NoFullyUnmeth.
Нуклеосомное позиционирование
nucleosome positioning · не структура ДНК, а её упаковка
- Подпись
- Не строго последовательность-специфична, но GC-состав и изгибная жёсткость сильно влияют на то, где нуклеосома сядет.
- Связь с 5mC
- DNMT3A/3B предпочитают нуклеосомную ДНК, а метилирование обогащено на нуклеосоме с периодичностью около 10 bp — периода витка спирали (Chodavarapu et al. 2010).
- Чем считать
- Автокорреляция per-CpG дельты HIGH−LOW по расстоянию в bp; MNase-seq K562; nanoNOMe / SMAC-seq — GpC-футпринтинг на той же ONT-молекуле, что и CpG-метилирование.
- Что предсказывает у нас
- Самое дешёвое из всех предсказаний на этой странице: если в дельте HIGH−LOW есть периодичность ~10 bp, то форму профиля задаёт нуклеосома, а не последовательность. Считается на уже имеющихся данных, сегодня, без новых экспериментов.
4. Слоты аннотации — пока пустые
Эта таблица — форма, которую нужно заполнить. Ни одно поле не заполнено выдуманным значением. Когда команды из раздела 6 будут прогнаны на Skynet, значения встанут сюда, а структурные дорожки — на рисунок в разделе 2.
| Элемент | Метод | Координаты | Скор | Перекрытие с CpG | Статус |
|---|---|---|---|---|---|
| G-квадруплекс | G4Hunter / pqsfinder | — | — | — | не вычислено |
| i-мотив | G4Hunter (rev-comp) | — | — | — | не вычислено |
| Z-ДНК | Z-Hunt / Non-B DB | — | — | — | не вычислено |
| R-петля (RLFS) | QmRLFS-finder | — | — | — | не вычислено |
| GC-skew | окно 100 bp | — | — | — | не вычислено |
| Инвертированные повторы | EMBOSS einverted | — | — | — | не вычислено |
| H-ДНК / триплекс | Triplexator | — | — | — | не вычислено |
| Периодичность ~10 bp в дельте | автокорреляция | — | — | — | данные уже есть |
| Асимметрия метилирования по цепям | ONT, разбивка по цепи | — | — | — | данные уже есть |
| TAD и границы доменов | Hi-C K562 / 4DN | — | — | — | не вычислено |
| Петли CTCF, ориентация мотива | JASPAR MA0139 + Hi-C | — | — | — | не вычислено |
5. 3D: локус в объёме
Выше масштаба вторичных структур начинается уровень, на котором CD55 уже не изолированный промотор, а часть плотного кластера генов с общей регуляторной архитектурой.
- Соседство. CD55 лежит на 1q32.2 внутри кластера RCA — регуляторов активации комплемента, где рядом стоят C4BPA/C4BPB, CR2, CR1, CR1L, CD46. Вопрос, который стоит задать данным: остаётся ли эффект ZFPoff/CRISPRoff строго на CD55, или соседние промоторы кластера тоже сдвигаются? У нас уже есть глубокие ONT-прогоны — off-target профилирование по этому кластеру возможно без новых экспериментов.
- Границы TAD. Первое, что нужно узнать: лежит ли окно −3,5…+2,8 kb внутри одного домена или на его границе. Это меняет интерпретацию — на границе преобладают CTCF-зависимые эффекты, внутри домена важнее локальные энхансеры.
- CTCF на −565 — самое интересное место всей страницы. Это единственный элемент, где 2D и 3D сходятся: 180 экспериментов ChIP-seq в K562 подтверждают связывание, связывание CTCF чувствительно к метилированию мотива, и CTCF — якорь хроматиновых петель. Если метилирование в HIGH вытесняет CTCF, то следствие — не только локальное, но и потеря петли, то есть изменение 3D.
- Ориентация мотива CTCF. Петли формируются между конвергентно ориентированными сайтами CTCF. Пока мы не просканируем окно на MA0139 и не узнаем ориентацию, мы не можем сказать, участвует ли этот сайт в петле вообще. Это скан по последовательности — быстро.
- Компартмент A/B. Статус локуса в K562 и в первичных T-клетках может различаться, и это одно из объяснений, почему кросс-типовая корреляция r = 0,784, а не выше.
- Одномолекулярный прокси на уже имеющихся данных. ONT даёт длинные риды: скоординированность метилирования вдоль одной молекулы на масштабе килобаз — это доступный нам суррогат доменной организации, который не требует Hi-C.
6. Механистические гипотезы
Каждая с явным тестом. H0 идёт первой намеренно: это объяснение, которое любая структурная гипотеза обязана победить, прежде чем её стоит рассматривать всерьёз.
Пик — это след эффектора, а не структура
Пик дифференциала #78–83 заканчивается ровно за 9 bp до протоспейсера CRISPRoff (+93…+112). Это в точности то, что даёт футпринт dCas9: метилирование ложится вплотную к месту посадки и обрывается там, где белок закрывает ДНК. Никакой вторичной структуры для объяснения положения пика не требуется. Пока эта версия не отвергнута, любое структурное объяснение положения пика — избыточная сущность.
Тест — решающий и уже возможный: у ZFPoff нет sgRNA, ZFP садится в другое место. Нужен сайт связывания ZFP (сейчас он не задан, см. раздел 1). Если сайт ZFP отличается от протоспейсера, а пик в K562 ZFPoff всё равно приходится на #78–83, то положение пика задаётся локусом, а не эффектором — и структурные гипотезы получают право на жизнь. Если пик сдвигается вслед за сайтом ZFP, вся эта страница относится к флангам, но не к пику.
G4 держит ядро промотора неметилированным
Плотное CpG-ядро складывается в G4, G4 ингибирует DNMT1, и поэтому BASE (7,4 %) и LOW (9,2 %) остаются низкими. HIGH (29,4 %) — состояние, в котором барьер продавлен принудительным рекрутингом DNMT.
Тест — G4Hunter плюс проверка по G4 ChIP-seq K562. Функционально: стабилизатор G4 (пиридостатин) на фоне ZFPoff должен замедлить набор метилирования, если гипотеза верна.
Метилирование само переводит участок в Z-форму
Здесь причинность обратная всем остальным гипотезам: не структура управляет метилированием, а метилирование создаёт структуру. 5mC резко стабилизирует Z-ДНК, поэтому в HIGH могли появиться Z-склонные участки, которых нет в LOW. Это давало бы вторичный, самоподдерживающийся слой репрессии.
Тест — Z-Hunt по окну; если (CG)n есть, то анти-Z-ДНК антитело или Zα-based CUT&RUN на отсортированных фракциях HIGH и LOW.
Потеря R-петли предшествует распространению метилирования
R-петля защищает неметилированный CGI-промотор от de novo метилирования. Замолкание убирает транскрипцию, транскрипция уносит с собой R-петлю, защита снимается — и метилирование расползается с ядра на фланги. Это объясняет, почему значимый блок такой широкий (#20–132, 3 kb), хотя эффектор садится в одну точку.
Тест — временной ряд, который у нас уже частично есть: если гипотеза верна, ядро метилируется раньше флангов. Сравнить форму профиля Day 6 / Day 28 / Day 35 — ширина блока должна расти со временем. Экспериментально: DRIP-seq на HIGH vs LOW.
Форму профиля задаёт нуклеосома
Тонкая структура дельты HIGH−LOW отражает не последовательность, а доступность: DNMT достаёт до CpG, обращённых наружу от октамера, и не достаёт до обращённых внутрь. Подпись — периодичность около 10 bp.
Тест — считается сегодня на имеющихся данных: автокорреляция per-CpG дельты по расстоянию в bp, пик на ~10 bp. Дальше — nanoNOMe / SMAC-seq, где футпринт хроматина и CpG-метилирование читаются с одной и той же молекулы.
Метилирование вытесняет CTCF и рвёт петлю
Мостик от 2D к 3D. CTCF на −565 лежит внутри значимого блока, его связывание чувствительно к метилированию мотива, и он служит якорем петли. Тогда следствие метилирования — не только локальное молчание, но и перестройка контактов всего участка.
Тест — сначала скан MA0139 на ориентацию мотива (по последовательности, быстро). Затем CTCF CUT&RUN на отсортированных HIGH и LOW; затем 4C или Capture-C с точкой обзора на промоторе CD55.
Границы блока — это границы структурного элемента
Сигнал не размывается плавно, он начинается на CpG #20 и обрывается на #132. Резкий край требует резкой причины: край структуры, край нуклеосомного массива, граница повтора или сайт CTCF.
Тест — пересечь координаты #20 и #132 с краями предсказанных элементов, с RepeatMasker и с сайтами CTCF. Совпадение в пределах десятков bp было бы сильной уликой; отсутствие совпадения гипотезу закрывает.
Структура формируется не на всех молекулах сразу
Структурные переходы — событие на уровне отдельной молекулы: на одной G4 сложился, на соседней нет. Усреднённый профиль это скрывает, а одномолекулярные данные — нет. Если элемент переключается по принципу «всё или ничего», молекулы должны распадаться на две моды по метилированию внутри элемента, а CpG внутри элемента — коррелировать между собой сильнее, чем просто соседние CpG на том же расстоянии.
Тест — полностью на имеющихся ONT-данных. Для каждого предсказанного элемента, покрывающего CpG i…j: (1) тест на бимодальность доли метилирования по молекулам, (2) попарная корреляция внутри элемента против фона, подобранного по расстоянию между CpG. Это, пожалуй, самое сильное применение одномолекулярного разрешения во всём проекте.
7. Как заполнить пустые слоты
Всё, что нужно для 2D-предсказаний — последовательность окна. Дальше — пересечение с координатами наших CpG.
# 1. Достать окно из референса (GRCh38) samtools faidx GRCh38.fa chr1:207318092-207324450 > cd55_window.fa # 2. G-квадруплексы на G-цепи python G4Hunter.py -i cd55_window.fa -o g4_out -w 25 -s 1.2 # 2b. То же через pqsfinder (обе цепи сразу) Rscript -e 'library(pqsfinder); library(Biostrings); s <- readDNAStringSet("cd55_window.fa")[[1]]; write.csv(as.data.frame(pqsfinder(s, strand="*")), "pqs.csv")' # 3. i-мотив = G4Hunter по обратно-комплементарной цепи seqkit seq -r -p cd55_window.fa > cd55_window_rc.fa python G4Hunter.py -i cd55_window_rc.fa -o imotif_out -w 25 -s 1.2 # 4. Z-ДНК (проверить порядок аргументов в своей сборке zhunt3) zhunt3 <window> <minsize> <maxsize> cd55_window.fa # 5. R-петли и GC-skew python QmRLFS-finder.py -i cd55_window.fa -o rlfs_out # 6. Инвертированные повторы -> крестообразные структуры einverted -sequence cd55_window.fa -gap 12 -threshold 50 \ -match 3 -mismatch -4 -outfile inv.out -outseq inv.fa # 7. Свободная энергия укладки, параметры ДНК (не РНК!) RNAfold --paramFile=dna_mathews2004.par < cd55_window.fa # 8. Мотив CTCF и его ориентация (JASPAR MA0139) fimo --thresh 1e-4 MA0139.meme cd55_window.fa # 9. Пересечь всё с нашими CpG # cd55_cpg_137.bed — 137 CpG из файла координат проекта # cd55_sig.bed — подмножество значимых (q < 0.05) bedtools intersect -a cd55_sig.bed -b structures.bed -wa -wb > overlap.tsv
.npy матрицы: периодичность ~10 bp в дельте HIGH−LOW (H4), асимметрия метилирования между цепями (i-мотив), бимодальность и внутриэлементная корреляция по молекулам (H7). С них и стоит начать.
8. Оговорки
- Ни одно структурное предсказание на этой странице не сделано. Все соответствующие поля помечены «не вычислено» намеренно — пустой слот лучше правдоподобного числа.
- TSS выведен арифметически из одного якоря (пик = +58 = chr1:207,321,678), а не взят из аннотации. Сходимость с положением дистальных ТФ обнадёживает, но это следует подтвердить по файлу координат.
- H0 не отвергнута. Пока сайт связывания ZFP не задан, положение пика полностью объясняется футпринтом эффектора, и структурные объяснения избыточны.
- Небиформные структуры динамичны и зависят от суперспирализации, а значит — от транскрипции. Они не свойство последовательности, а свойство состояния. Предсказание по последовательности даёт лишь список мест, где такое возможно.
- Все ChIP-seq данные ENCODE — с несортированной популяции K562, а не с фракций LOW и HIGH. Это тот же ограничитель, что и на странице ChIP-seq: мы сравниваем наш отсортированный сигнал с чужим усреднённым.
- Baseline (Day 2, mock) отличается от LOW/HIGH (Day 16) и по времени, и по процедуре. Любое структурное сравнение с baseline наследует этот конфаундер.
- Совпадение координат — не механизм. Даже идеальное перекрытие предсказанного G4 с пиком метилирования остаётся корреляцией, пока нет функционального возмущения.
Источники
Ссылки на статьи даны как поиск по PubMed, а не как прямые DOI — прямые адреса не проверялись из этой среды, а непроверенная ссылка хуже, чем поиск, который точно откроется.
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 12
- 13
- 14
- 15
- 16
- 17