Read — что видит секвенатор

K562: сортировка по уровню метилирования CD55 — полный разбор

Другая клеточная линия, другой способ разделения: вместо донорских T-клеток — K562, и вместо просто «отредактировано / не отредактировано» — сортировка по уровню метилирования CD55 (LOW/HIGH), считанному через экспрессию CD55 на поверхности клетки (проточная цитометрия) как readout, Day 16 после ZFPoff. То же самое считывание — метилирование по 137 CpG-сайтам на одной молекуле ДНК. Эта страница — полная версия анализа: профиль по каждому CpG, одномолекульные паттерны, ML-классификаторы, статистика по каждой позиции, геномные координаты и проверка на независимых данных T-клеток.

Группы получены не в одной и той же временной точке. CD55-LOW и CD55-HIGH — Day 16 после настоящего ZFPoff-редактирования, отсортированы по уровню метилирования CD55 (считанному через экспрессию CD55 на поверхности клетки). Baseline — K562 на Day 2 пассирования после «фейкового» (контрольного, мок-) редактирования, не после настоящего ZFPoff и не в тот же день. Значит, сравнения LOW-vs-baseline и HIGH-vs-baseline смешивают «отредактировано/нет» с разницей во времени и пассировании. Сравнение LOW vs HIGH — единственное, где оба образца взяты в один день (Day 16) после одной и той же процедуры и отличаются только воротами сортировки; на него стоит полагаться в первую очередь.
Профиль метилирования

137 CpG-сайтов, три группы

Доля молекул, помеченных как метилированные, в каждой из 137 позиций (порог вызова метилирования 0,995 — см. пояснение по чувствительности к порогу ниже).

Ожидаемое направление, а не противоречие модели: CD55-HIGH — фракция с высоким уровнем метилирования CD55 (29,4%), CD55-LOW — с низким (9,2%), что близко к уровню мок-контроля Day 2 (7,4%; см. оговорку про разные временные точки выше). LOW/HIGH здесь обозначают именно уровень метилирования, а не экспрессии: сортировка шла проточной цитометрией по CD55 на поверхности клетки как readout’у метилирования, поэтому более метилированная фракция (HIGH) ожидаемо соответствует более низкой поверхностной экспрессии CD55 — это согласуется с классической моделью «метилирование промотора → выключение гена», а не противоречит ей.

Одна молекула за раз

Паттерны метилирования по отдельным молекулам

Каждая строка — одна молекула ДНК (показаны абсолютно все, без подвыборки); каждая точка — одна из 137 позиций CpG, закрашена, если сайт помечен как метилированный. Молекулы отсортированы по плотности метилирования, от самых метилированных до самых неметилированных; если молекул много — панель прокручивается.

Нагрузка метилирования

Распределение по отдельным молекулам

Для каждой молекулы — какой процент из 137 CpG помечен как метилированный. Одно значение на молекулу.

Машинное обучение

Классификаторы: какие пары групп различимы?

Логистическая регрессия (L1) и случайный лес, 5-фолдовая кросс-валидация. Каждая отдельная молекула — один пример для обучения (137 бинарных признаков — по одному на CpG). Для каждой позиции отдельно — точный тест Фишера с поправкой Бенджамini–Хохберга (FDR).

Значимость по позициям

Какие именно CpG различают LOW и HIGH

Каждая точка — одна из 137 позиций CpG. Высота — статистическая значимость (−log₁₀ p, тест Фишера); яркость — совмещённая оценка значимости и важности признака в моделях. Пунктир — порог q < 0,05.

Топ различающих CpG

15 самых информативных позиций (LOW vs HIGH)

Ранжировано по совмещённой оценке (значимость + вес в логистической регрессии + важность в случайном лесе). Столбики — разница в проценте метилирования (HIGH − LOW).

Устойчивость к порогу

Чувствительность к порогу вызова метилирования

Для каждой группы есть два файла одного и того же прогона Oxford Nanopore — не биологические повторы, а два порога уверенности для решения «этот C метилирован или нет»: 0,7 (мягкий) и 0,995 (строгий). Ниже — насколько по-прежнему похож профиль метилирования по 137 CpG при смене порога.

Все ключевые цифры на странице используют строгий порог 0,995 — тот же, что и в T-клеточном датасете. Порог 0,7 показан только здесь, для проверки устойчивости паттерна.

Геномные координаты

Ампликон охватывает точку старта транскрипции CD55

Координаты (GRCh38, chr1:207 318 092–207 324 450) показывают, что старт транскрипции CD55 (chr1:207 321 678) лежит внутри самого ампликона, между CpG #69 и #70. Три известных сайта связывания KLF4 — главного активатора CD55 — почти точно совпадают с реальными CpG в этих данных.

Самые значимые CpG (#78–83) лежат в +58…+84 п.н. от старта транскрипции — сразу за ним, а не в самом промоторе. Основной значимый кластер (#20–132) охватывает от −1077 до +1935 п.н. — весь промотор KLF4/CRE, точку старта и заметную часть гена ниже по цепи.

Помимо KLF4, регуляторами CD55 в литературе называют TFCP2 и NF-κB, а также посттранскрипционный контроль через miR-27a-3p. Метилирование промотора CD55 изучалось на онкологических когортах (например, через ресурс SurvivalMeth), но подробностей по отдельным CpG в открытых источниках немного.

Направление эффекта согласуется с классической моделью. LOW/HIGH здесь — уровень метилирования CD55, а не экспрессии: клетки сортировались проточной цитометрией по CD55 на поверхности, где высокая поверхностная экспрессия соответствует низкому метилированию (LOW), а низкая экспрессия — высокому метилированию (HIGH). Различие лежит именно в области, напрямую перекрывающей TSS и известные сайты активатора KLF4 — то есть там, где метилирование действительно могло бы подавлять транскрипцию. Ниже — проверка на T-клетках: то же направление воспроизводится независимо, значит дело не в артефакте K562 или сортировки.
Проверка на другой клеточной линии

Тот же сдвиг виден и в T-клетках

Независимый набор данных с этого же сайта — Day 6, CRISPRoff против необработанных T-клеток (те же 137 CpG) — даёт возможность проверить, не артефакт ли это сортировки именно в K562.

корреляция Пирсона между дельтой K562 (HIGH−LOW) и дельтой T-клеток (CRISPRoff−unedited) по всем 137 CpG

Это независимое подтверждение: направление эффекта (больше метилирования при более сильном сигнале CRISPRoff/CD55) воспроизводится в другой клеточной линии и другом способе сравнения групп — значит, дело не в артефакте сортировки K562.

Открытые вопросы

Что ещё предстоит проверить

Baseline ≠ Day 16, unedited. Baseline — это K562 на Day 2 пассирования после мок- («фейкового») редактирования, а не необработанные клетки того же дня, что LOW/HIGH. Любое сравнение с участием baseline (HIGH-vs-baseline, LOW-vs-baseline) может отражать не только эффект ZFPoff, но и разницу во времени/пассировании/самой процедуры мок-редактирования. Сравнение LOW vs HIGH этой проблемы не имеет.
Методологическое пояснение: почему именно этот порог. У каждой группы (LOW, HIGH и baseline) по два файла — это не биологические повторы, а один и тот же прогон Oxford Nanopore, вызванный при двух порогах уверенности для решения «этот C метилирован или нет»: 0,7 (мягкий) и 0,995 (строгий). Все ключевые цифры на этой странице используют строгий порог 0,995 — тот же, что и в T-клеточном датасете, для честного сравнения. Мягкий порог 0,7 показан только в разделе «Чувствительность к порогу» выше, как проверка устойчивости паттерна, а не как отдельные, самостоятельные данные.
Прямое, парное подтверждение экспрессии по каждой фракции пока не сделано. Уровень метилирования (LOW/HIGH) в этих данных считывался через CD55 на поверхности клетки при сортировке, но самого измерения экспрессии на тех же одиночных клетках, для которых есть данные по метилированию, в этом датасете нет. Ожидаемая обратная связь (выше метилирование → ниже поверхностная экспрессия) следует из модели и из способа сортировки, а не из прямого совместного считывания. Кроме того: (1) на Day 16 метилирование могло ещё не полностью «докатиться» до подавления экспрессии, либо идёт временная/компенсаторная волна метилирования; (2) сортировка по поверхностному белку могла захватить существующую гетерогенность клеток, не связанную напрямую с работой ZFPoff именно в этом локусе. Эти вопросы касаются интерпретации механизма; сам результат LOW vs HIGH (см. выше) от них не зависит.
Источники

Ссылки