Learn — форма ДНК на нашем окне

Что ДНК делает со своей формой
в области TSS CD55

Наши профили метилирования — одномерные: 137 CpG вдоль 6,4 kb. Но ДНК в этом окне не прямая линия. Она может складываться в G-квадруплексы, i-мотивы, Z-форму, R-петли, крестообразные структуры — и всё это укладывается в петли и домены хроматина. Эта страница — карта того, где такие структуры искать и как связать их с тем, что мы уже измерили.

Ни одна структура на этой странице ещё не предсказана. Здесь нет ни одного вычисленного G4-скора, ни одной координаты Z-ДНК, ни одного Hi-C контакта. Все такие поля стоят пустыми и помечены «не вычислено». Реальные числа на странице — только те, что уже получены в проекте: координаты, позиции CpG, позиции ChIP-seq пиков. Чтобы заполнить пустые слоты, нужна последовательность окна — команды приведены в разделе 6.

1. Система координат

Всё на этой странице привязано к одному окну. Прежде чем накладывать структуру на метилирование, координаты должны совпадать до пары оснований — иначе «перекрытие» ничего не значит.

Величина Значение Откуда
Окно анализа (GRCh38)chr1:207,318,092–207,324,450Файл координат проекта
Длина окна6,358 bpВычислено: конец − начало
TSS (выведен, требует подтверждения)≈ chr1:207,321,620Вычислено из якоря: пик CpG #78–83 = chr1:207,321,678 = +58 bp
Окно относительно TSS−3,528 … +2,830Вычислено. Сходится: MAZ/GATA1/NFE2 на ≈−3,4 kb попадают внутрь левого края
Число CpG137Файл координат проекта
Плотность CpG, всё окно2,15 / 100 bpВычислено: 137 / 6 358
Значимый блок #20–132 (LOW vs HIGH)−1,077 … +1,935Анализ K562 Day 16
Плотность CpG в блоке3,75 / 100 bp (113 CpG / 3 012 bp)Вычислено
Пик дифференциала #78–83+58 … +84Анализ K562 Day 16
Плотность CpG в пике22,2 / 100 bp (6 CpG / 27 bp)Вычислено — один CpG каждые 4,5 bp
Протоспейсер CRISPRoff (T-клетки)+93 … +112Датасет T-клеток; пик заканчивается за 9 bp до него
Сайт связывания ZFP (K562 ZFPoff)не заданНужен от нас — без него нельзя отделить структуру от следа эффектора
Плотность — это уже подсказка. 22 CpG на 100 bp в пике #78–83 — это не просто «CpG-остров», это очень G/C-насыщенный микроучасток. Именно такая композиция необходима (хотя и недостаточна) для G-квадруплекса на G-цепи и i-мотива на C-цепи. Это не предсказание структуры — это наблюдение, что композиционное условие выполнено и предсказание имеет смысл считать.

2. Что уже нанесено на этот локус

Ниже — только измеренное: блок значимых CpG, пик дифференциала, ChIP-seq пики K562 и три литературных CACCC-сайта KLF4. Структурные треки лягут поверх этой же оси.

Карта окна CD55: обзор всего окна и увеличенный вид коровой области промотора ВСЁ ОКНО · 6 358 bp #20–132 #78–83 −3000−2000−1000 0+1000+2000 MAZ/GATA1/NFE2 TSS КОРОВАЯ ОБЛАСТЬ · −800 … +200 bp ← блок #20–132 продолжается за оба края #78–83 протоспейсер 9 bp CBA KLF4 CACCC NRF1 −740 CTCF −565 NR2C2 −371 EP300/ATF1 −236 POLR2A −117 Pol II pS5 −70 POLR2G +10 −800−600−400 −2000+200 позиция, bp относительно TSS
Значимые CpG, LOW vs HIGH (q<0,05) Пик дифференциала #78–83 Протоспейсер CRISPRoff (T-клетки) CACCC-сайты KLF4 (литература) ChIP-seq K562, метилирование-чувствительный ТФ ChIP-seq K562, прочие факторы
Позиции ТФ — центры ChIP-seq пиков K562 (ENCODE через UCSC API), проверенные вручную. CACCC-сайты KLF4 — из литературы, не ChIP-seq: прямого ChIP-подтверждения KLF4 в этом окне нет ни в одной клеточной линии. Ось — выведенный TSS, см. раздел 1. Структурные дорожки (G4, Z-ДНК, R-петли) лягут между блоком CpG и осью — сейчас эта полоса пуста, потому что ничего не посчитано.

3. 2D: небиформная ДНК

Семь классов структур, которые могут возникать в промоторной области. Для каждого — последовательностная подпись, документированная связь с 5mC, чем считать и что это предсказывает для наших групп LOW / HIGH / BASE.

Схематические изображения шести классов небиформных структур ДНК G4 G-цепь i-motif C-цепь B Z Z-DNA R-loop РНК:ДНК гибрид Крестообразная Нуклеосома
Схемы, не масштаб и не структурные модели. H-ДНК (триплекс) не показана — см. карточку ниже.

G-квадруплекс

G4 · G-quadruplex

Подпись
Четыре трека по ≥3 гуанинов с петлями 1–7 нт. Формируется на G-цепи; комплементарная C-цепь при этом остаётся одноцепочечной или сама сворачивается в i-мотив.
Связь с 5mC
Документированная и направленная: G4 ингибируют DNMT1 и локально удерживают гипометилирование; G4 обогащены в неметилированных CGI-промоторах (Mao et al. 2018).
Чем считать
G4Hunter (окно 25, порог 1,2), pqsfinder. Экспериментально: G4-seq и G4 ChIP-seq в K562 (Hänsel-Hertsch et al. 2016) — для нас это правильная клеточная линия.
Что предсказывает у нас
Если G4 перекрывает плотное ядро CpG, он может быть причиной, по которой BASE и LOW держатся на 7,4 % и 9,2 %. Тогда ZFPoff/CRISPRoff — это «продавливание» структурного барьера, а HIGH (29,4 %) — состояние, где барьер снят.

i-мотив

i-motif · C-rich counterpart

Подпись
C-богатая цепь, комплементарная G4-мотиву. Зависит от pH и отрицательной суперспирализации; в клетке существует, показан антителом iMab (Zeraati et al. 2018).
Связь с 5mC
Существует, но направление контекст-зависимо: 5mC сдвигает переходный pH и термостабильность i-мотива, и в литературе описаны сдвиги в обе стороны. Не принимать знак эффекта на веру — проверять для конкретной последовательности.
Чем считать
G4Hunter по обратно-комплементарной цепи (C-богатая сторона), затем сопоставить с G4-предсказаниями — они должны быть на одних координатах, на разных цепях.
Что предсказывает у нас
Асимметрию между цепями. Это самое ценное здесь: ONT читает каждую цепь отдельно, поэтому мы можем измерить метилирование по цепям прямо на имеющихся данных — новых экспериментов не нужно.

Z-ДНК

Z-DNA · левозакрученная форма

Подпись
Чередование пурин/пиримидин, прежде всего повторы (CG)n и (CA)n. Требует отрицательной суперспирализации — то есть возникает позади движущейся РНК-полимеразы.
Связь с 5mC
Самая сильная и самая старая из всех перечисленных: 5-метилцитозин резко стабилизирует Z-форму, снижая необходимую ионную силу на порядки (Behe & Felsenfeld 1981).
Чем считать
Z-Hunt (zhunt3), готовые треки Z-ДНК в Non-B DB для hg38.
Что предсказывает у нас
Единственный класс, где наше вмешательство — причина структуры, а не следствие. Если рядом со следом эффектора есть (CG)n, то HIGH может быть Z-склонным, а LOW — нет, и это следствие редактирования, а не исходное свойство локуса.

R-петля

R-loop · РНК:ДНК гибрид + вытесненная цепь

Подпись
GC-skew: избыток G на нематричной цепи ниже TSS. Ко-транскрипционная структура — без транскрипции не образуется.
Связь с 5mC
R-петли характерны именно для неметилированных CGI-промоторов и защищают их от de novo метилирования DNMT3B1 (Ginno et al. 2012).
Чем считать
QmRLFS-finder плюс GC-skew в скользящем окне 100 bp. Экспериментально — DRIP-seq / qDRIP.
Что предсказывает у нас
Обратную связь и, главное, порядок событий: замолкание → падение транскрипции → потеря R-петли → снятие защиты → распространение метилирования на фланги. Это предсказывает временную задержку — ядро метилируется раньше флангов. Проверяемо на серии Day 2 → 16 → 35.

Крестообразная структура

cruciform · инвертированные повторы

Подпись
Инвертированные повторы длиной ≥6 bp с коротким спейсером. Экструзия зависит от суперспирализации.
Связь с 5mC
Прямая связь документирована слабо. Есть общее соображение, что шпилечная ДНК — плохой субстрат для DNMT, но для этого локуса это гипотеза, а не установленный факт.
Чем считать
EMBOSS einverted; треки cruciform в Non-B DB.
Что предсказывает у нас
Кандидат на объяснение резких границ значимого блока. Почему сигнал начинается на CpG #20 и обрывается на #132, а не размывается плавно? Границы структурного элемента — одно из немногих объяснений резкого края.

H-ДНК / триплекс

H-DNA · внутримолекулярный триплекс

Подпись
Зеркальные пурин-богатые повторы (полипурин/полипиримидин).
Связь с 5mC
Слабая и плохо документированная. Основной эффект триплексов — блок элонгации Pol II, а не изменение метилирования.
Чем считать
Triplexator; треки H-DNA в Non-B DB.
Что предсказывает у нас
Низкий приоритет для механизма. Но проверить стоит по технической причине: триплексы и другие структуры дают обрывы ONT-ридов и ошибки картирования, а это уже влияло бы на наши покрытия и на фильтр NoFullyUnmeth.

Нуклеосомное позиционирование

nucleosome positioning · не структура ДНК, а её упаковка

Подпись
Не строго последовательность-специфична, но GC-состав и изгибная жёсткость сильно влияют на то, где нуклеосома сядет.
Связь с 5mC
DNMT3A/3B предпочитают нуклеосомную ДНК, а метилирование обогащено на нуклеосоме с периодичностью около 10 bp — периода витка спирали (Chodavarapu et al. 2010).
Чем считать
Автокорреляция per-CpG дельты HIGH−LOW по расстоянию в bp; MNase-seq K562; nanoNOMe / SMAC-seq — GpC-футпринтинг на той же ONT-молекуле, что и CpG-метилирование.
Что предсказывает у нас
Самое дешёвое из всех предсказаний на этой странице: если в дельте HIGH−LOW есть периодичность ~10 bp, то форму профиля задаёт нуклеосома, а не последовательность. Считается на уже имеющихся данных, сегодня, без новых экспериментов.

4. Слоты аннотации — пока пустые

Эта таблица — форма, которую нужно заполнить. Ни одно поле не заполнено выдуманным значением. Когда команды из раздела 6 будут прогнаны на Skynet, значения встанут сюда, а структурные дорожки — на рисунок в разделе 2.

Элемент Метод Координаты Скор Перекрытие с CpG Статус
G-квадруплексG4Hunter / pqsfinderне вычислено
i-мотивG4Hunter (rev-comp)не вычислено
Z-ДНКZ-Hunt / Non-B DBне вычислено
R-петля (RLFS)QmRLFS-finderне вычислено
GC-skewокно 100 bpне вычислено
Инвертированные повторыEMBOSS einvertedне вычислено
H-ДНК / триплексTriplexatorне вычислено
Периодичность ~10 bp в дельтеавтокорреляцияданные уже есть
Асимметрия метилирования по цепямONT, разбивка по цепиданные уже есть
TAD и границы доменовHi-C K562 / 4DNне вычислено
Петли CTCF, ориентация мотиваJASPAR MA0139 + Hi-Cне вычислено

5. 3D: локус в объёме

Выше масштаба вторичных структур начинается уровень, на котором CD55 уже не изолированный промотор, а часть плотного кластера генов с общей регуляторной архитектурой.

Где брать 3D-данные. Портал 4D Nucleome и ENCODE — Hi-C и Micro-C для K562; Rao et al. 2014 — карты петель высокого разрешения, включая K562; Javierre et al. 2016 — promoter capture Hi-C для клеток крови, в том числе T-клеток, что даёт нам вторую клеточную систему на том же локусе.

6. Механистические гипотезы

Каждая с явным тестом. H0 идёт первой намеренно: это объяснение, которое любая структурная гипотеза обязана победить, прежде чем её стоит рассматривать всерьёз.

H0

Пик — это след эффектора, а не структура

Пик дифференциала #78–83 заканчивается ровно за 9 bp до протоспейсера CRISPRoff (+93…+112). Это в точности то, что даёт футпринт dCas9: метилирование ложится вплотную к месту посадки и обрывается там, где белок закрывает ДНК. Никакой вторичной структуры для объяснения положения пика не требуется. Пока эта версия не отвергнута, любое структурное объяснение положения пика — избыточная сущность.

Тест — решающий и уже возможный: у ZFPoff нет sgRNA, ZFP садится в другое место. Нужен сайт связывания ZFP (сейчас он не задан, см. раздел 1). Если сайт ZFP отличается от протоспейсера, а пик в K562 ZFPoff всё равно приходится на #78–83, то положение пика задаётся локусом, а не эффектором — и структурные гипотезы получают право на жизнь. Если пик сдвигается вслед за сайтом ZFP, вся эта страница относится к флангам, но не к пику.

H1

G4 держит ядро промотора неметилированным

Плотное CpG-ядро складывается в G4, G4 ингибирует DNMT1, и поэтому BASE (7,4 %) и LOW (9,2 %) остаются низкими. HIGH (29,4 %) — состояние, в котором барьер продавлен принудительным рекрутингом DNMT.

Тест — G4Hunter плюс проверка по G4 ChIP-seq K562. Функционально: стабилизатор G4 (пиридостатин) на фоне ZFPoff должен замедлить набор метилирования, если гипотеза верна.

H2

Метилирование само переводит участок в Z-форму

Здесь причинность обратная всем остальным гипотезам: не структура управляет метилированием, а метилирование создаёт структуру. 5mC резко стабилизирует Z-ДНК, поэтому в HIGH могли появиться Z-склонные участки, которых нет в LOW. Это давало бы вторичный, самоподдерживающийся слой репрессии.

Тест — Z-Hunt по окну; если (CG)n есть, то анти-Z-ДНК антитело или Zα-based CUT&RUN на отсортированных фракциях HIGH и LOW.

H3

Потеря R-петли предшествует распространению метилирования

R-петля защищает неметилированный CGI-промотор от de novo метилирования. Замолкание убирает транскрипцию, транскрипция уносит с собой R-петлю, защита снимается — и метилирование расползается с ядра на фланги. Это объясняет, почему значимый блок такой широкий (#20–132, 3 kb), хотя эффектор садится в одну точку.

Тест — временной ряд, который у нас уже частично есть: если гипотеза верна, ядро метилируется раньше флангов. Сравнить форму профиля Day 6 / Day 28 / Day 35 — ширина блока должна расти со временем. Экспериментально: DRIP-seq на HIGH vs LOW.

H4

Форму профиля задаёт нуклеосома

Тонкая структура дельты HIGH−LOW отражает не последовательность, а доступность: DNMT достаёт до CpG, обращённых наружу от октамера, и не достаёт до обращённых внутрь. Подпись — периодичность около 10 bp.

Тест — считается сегодня на имеющихся данных: автокорреляция per-CpG дельты по расстоянию в bp, пик на ~10 bp. Дальше — nanoNOMe / SMAC-seq, где футпринт хроматина и CpG-метилирование читаются с одной и той же молекулы.

H5

Метилирование вытесняет CTCF и рвёт петлю

Мостик от 2D к 3D. CTCF на −565 лежит внутри значимого блока, его связывание чувствительно к метилированию мотива, и он служит якорем петли. Тогда следствие метилирования — не только локальное молчание, но и перестройка контактов всего участка.

Тест — сначала скан MA0139 на ориентацию мотива (по последовательности, быстро). Затем CTCF CUT&RUN на отсортированных HIGH и LOW; затем 4C или Capture-C с точкой обзора на промоторе CD55.

H6

Границы блока — это границы структурного элемента

Сигнал не размывается плавно, он начинается на CpG #20 и обрывается на #132. Резкий край требует резкой причины: край структуры, край нуклеосомного массива, граница повтора или сайт CTCF.

Тест — пересечь координаты #20 и #132 с краями предсказанных элементов, с RepeatMasker и с сайтами CTCF. Совпадение в пределах десятков bp было бы сильной уликой; отсутствие совпадения гипотезу закрывает.

H7

Структура формируется не на всех молекулах сразу

Структурные переходы — событие на уровне отдельной молекулы: на одной G4 сложился, на соседней нет. Усреднённый профиль это скрывает, а одномолекулярные данные — нет. Если элемент переключается по принципу «всё или ничего», молекулы должны распадаться на две моды по метилированию внутри элемента, а CpG внутри элемента — коррелировать между собой сильнее, чем просто соседние CpG на том же расстоянии.

Тест — полностью на имеющихся ONT-данных. Для каждого предсказанного элемента, покрывающего CpG i…j: (1) тест на бимодальность доли метилирования по молекулам, (2) попарная корреляция внутри элемента против фона, подобранного по расстоянию между CpG. Это, пожалуй, самое сильное применение одномолекулярного разрешения во всём проекте.

7. Как заполнить пустые слоты

Всё, что нужно для 2D-предсказаний — последовательность окна. Дальше — пересечение с координатами наших CpG.

# 1. Достать окно из референса (GRCh38)
samtools faidx GRCh38.fa chr1:207318092-207324450 > cd55_window.fa

# 2. G-квадруплексы на G-цепи
python G4Hunter.py -i cd55_window.fa -o g4_out -w 25 -s 1.2

# 2b. То же через pqsfinder (обе цепи сразу)
Rscript -e 'library(pqsfinder); library(Biostrings);
  s <- readDNAStringSet("cd55_window.fa")[[1]];
  write.csv(as.data.frame(pqsfinder(s, strand="*")), "pqs.csv")'

# 3. i-мотив = G4Hunter по обратно-комплементарной цепи
seqkit seq -r -p cd55_window.fa > cd55_window_rc.fa
python G4Hunter.py -i cd55_window_rc.fa -o imotif_out -w 25 -s 1.2

# 4. Z-ДНК (проверить порядок аргументов в своей сборке zhunt3)
zhunt3 <window> <minsize> <maxsize> cd55_window.fa

# 5. R-петли и GC-skew
python QmRLFS-finder.py -i cd55_window.fa -o rlfs_out

# 6. Инвертированные повторы -> крестообразные структуры
einverted -sequence cd55_window.fa -gap 12 -threshold 50 \
  -match 3 -mismatch -4 -outfile inv.out -outseq inv.fa

# 7. Свободная энергия укладки, параметры ДНК (не РНК!)
RNAfold --paramFile=dna_mathews2004.par < cd55_window.fa

# 8. Мотив CTCF и его ориентация (JASPAR MA0139)
fimo --thresh 1e-4 MA0139.meme cd55_window.fa

# 9. Пересечь всё с нашими CpG
#    cd55_cpg_137.bed  — 137 CpG из файла координат проекта
#    cd55_sig.bed      — подмножество значимых (q < 0.05)
bedtools intersect -a cd55_sig.bed -b structures.bed -wa -wb > overlap.tsv
Две проверки перед тем, как чему-то верить. Первая: координаты выхода этих программ — относительно начала окна, а не хромосомы. Прибавить 207 318 091 (или 207 318 092, в зависимости от того, 0- или 1-based выход) и проверить на известной точке — координата CpG-пика должна лечь на chr1:207,321,678. Вторая: у всех этих предсказателей высокая доля ложных срабатываний. Предсказание G4 — это не G4. Ценность имеет только совпадение предсказания с независимым экспериментальным треком (G4-seq, DRIP-seq, Non-B DB) или с нашим собственным сигналом метилирования.
Что можно посчитать до всякой последовательности. Три анализа из этой страницы не требуют ни референса, ни новых экспериментов — только уже лежащие на Skynet .npy матрицы: периодичность ~10 bp в дельте HIGH−LOW (H4), асимметрия метилирования между цепями (i-мотив), бимодальность и внутриэлементная корреляция по молекулам (H7). С них и стоит начать.

8. Оговорки

Источники

Ссылки на статьи даны как поиск по PubMed, а не как прямые DOI — прямые адреса не проверялись из этой среды, а непроверенная ссылка хуже, чем поиск, который точно откроется.

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17