K562 · ChIP-seq · публичные данные ENCODE

Кто сидит на промоторе CD55 — и почему именно там метилирование различает LOW и HIGH

На странице K562 мы нашли кластер CpG-сайтов, чьё метилирование чётче всего различает фракции CD55-LOW и CD55-HIGH — он лежит прямо на точке старта транскрипции CD55 и рядом с ней. Эта страница — попытка понять, почему именно там: какие транскрипционные факторы в K562, по данным ENCODE ChIP-seq, физически садятся на этот участок ДНК, и какие из них по литературе чувствительны к метилированию CpG.

Регион

Одно и то же окно, что и на странице K562

Координаты и значимый кластер (LOW vs HIGH, q<0,05) взяты напрямую с страницы K562 — это то же самое окно chr1:207 318 092–207 324 450 (GRCh38), с точкой старта транскрипции CD55 при chr1:207 321 678.

Трек связывания

CpG-значимость и связывание факторов — в одном окне координат

Верхняя дорожка — та же статистика, что на Manhattan-графике страницы K562 (объединённая оценка значимости по каждому CpG). Ниже — реальные пики ChIP-seq транскрипционных факторов в K562 (ENCODE), выровненные по тем же геномным координатам. Оранжевая полоса — значимый кластер CpG (#20–132), жёлтая — пик сигнала (#78–83).

Подтверждено в K562

Факторы с реальным пиком ChIP-seq в K562 в этом окне

Каждая строка проверена отдельным, узким запросом к API UCSC Genome Browser (не одним общим запросом на весь список — см. оговорку о методе ниже) и подтверждена как минимум одним экспериментом ENCODE именно в клетках K562.

Есть пик, но не в K562

DNMT3B: метилтрансфераза рядом — но не подтверждена в K562

В этом же окне есть пик ChIP-seq для DNMT3B — фермента, который сам устанавливает метилирование CpG — но единственный поддерживающий эксперимент ENCODE сделан в клетках HepG2, не K562. Это не значит, что DNMT3B не работает здесь в K562 — просто нет прямого ChIP-seq подтверждения именно в этой линии.

Открытый вопрос

Чего нет: KLF4 и TFCP2 без ChIP-seq-подтверждения

На странице K562 и в литературе про CD55 главным кандидатом на роль активатора называют KLF4 (три сайта CACCC-box рядом с TSS), также упоминаются TFCP2 и NF-κB (RELA/NFKB1). Но ни для одного из них в проверенных треках ENCODE ChIP-seq (ни в K562, ни в любой другой линии) нет пика, перекрывающего это окно:

Отсутствие ChIP-seq пика — не доказательство отсутствия связывания: возможно, эти факторы просто не профилированы ChIP-seq методом именно в K562 на этом участке, либо связывание слишком слабое/транзиентное для колл-пика. Гипотеза «KLF4 через CACCC-box» пока остаётся мотив-based и функциональной (из литературы), но не подтверждённой ChIP-seq в K562.

Механистическая гипотеза

CTCF и NRF1 — лучшие кандидаты на «метилирование мешает связыванию»

Из подтверждённых в K562 факторов два — CTCF и NRF1 — хорошо задокументированы в литературе именно как факторы, чьё связывание с ДНК напрямую блокируется метилированием CpG в их сайте узнавания (это не просто корреляция «активный хроматин ≈ неметилирован», а прямой, показанный в экспериментах механизм конкуренции метилирования и белка за один и тот же участок ДНК).

Оба сидят внутри значимого кластера CpG (#20–132) — CTCF на #43–86 (chr1:207 320 854–207 321 372), NRF1 на #13–43 (chr1:207 320 698–207 321 177). Правдоподобная гипотеза: рост метилирования в группе CD55-HIGH может напрямую вытеснять один или оба этих фактора с их сайтов связывания в этой области — а не просто быть побочным следствием более широкого молчания гена.

Отдельно: РНК-полимераза II (общая и инициирующая Ser5-P формы), а также коактиватор EP300/p300 и CRE-связывающий ATF1 — тоже прямо в этом окне. Это подтверждает, что участок действительно активно задействован в транскрипционной машинерии в K562 — то есть перепад метилирования происходит не в «мёртвой» зоне генома, а в реально работающем промоторном модуле.

Это гипотеза, а не доказанный механизм: у нас нет ChIP-seq CTCF/NRF1 отдельно для фракций CD55-LOW и CD55-HIGH — только общий каталог ENCODE K562 (смешанная популяция). Прямая проверка потребовала бы ChIP-seq или CUT&RUN на CTCF/NRF1 в самих отсортированных LOW/HIGH фракциях.

Об источнике данных

Как получены эти данные, и что стоит перепроверить

Источник: UCSC Genome Browser REST API (треки ENCODE 3 «TF ChIP-seq Clusters», объединённый по клеточным линиям, и ENCODE 4 «TF Representative Peak Clusters», с разбивкой по клеточным линиям) — запрошены напрямую по координатам chr1:207 318 092–207 324 450 (hg38). Прямой доступ к ENCODE portal REST API и к сырым файлам bigBed из этой среды заблокирован сетевой политикой песочницы; данные получены через инструмент постраничного веб-фетча, который прогоняет содержимое через суммаризирующую модель, а не отдаёт сырой JSON напрямую.
Из-за этого — каждый фактор в таблице выше перепроверен минимум дважды отдельными, узкими запросами («есть ли фактор X в этом окне — да/нет, с полным сырым JSON»), а не одним большим запросом на весь список сразу: при широких запросах модель иногда пропускала реально существующие записи или, наоборот, «находила» записи, которых при точечной проверке не оказывалось. Факторы, которые не подтвердились при повторной точечной проверке (в том числе изначально предполагавшиеся TFCP2, CREB1, SP1, KLF1), в итоговую таблицу не включены.
Кластеры ENCODE ChIP-seq систематически показывают много факторов на любом активном промоторе («гиперэффективные» для ChIP-seq области) — само по себе присутствие десятков факторов в окне не означает, что каждый из них специфичен именно для CD55. Список на этой странице сознательно сокращён до факторов, которые (а) подтверждены именно в K562 и (б) либо перекрывают значимый кластер CpG, либо есть содержательная причина их показать (например, эритроидные факторы на краю окна).
Для публикации это стоит перепроверить напрямую: скачать bigBed-файлы ENCODE ChIP-seq треков (hgdownload.soe.ucsc.edu) и распарсить bigBedToBed/pyBigWig вместо запроса через API с суммаризацией — это не было технически доступно в данной среде (сетевые ограничения песочницы), но полностью выполнимо на обычной рабочей машине.
Источники

Ссылки