Каталог данных · epicme.bio

Всё публичное про первичные человеческие T-клетки — по модальностям

Агрегированный каталог открытых наборов данных по первичным T-клеткам: bulk RNA-seq, single-cell RNA-seq, CITE-seq (РНК + белок), WGBS и EM-seq метилирование, CAGE/TSS, ATAC и ChIP-seq, eQTL. Собран под конкретную задачу — найти парный сигнал «экспрессия ↔ метилирование» на локусе CD55, чтобы разблокировать модель «ДНК + метилирование → ген on/off» из раздела 5 страницы Foundation-моделей.

1. Как читать этот каталог

Наборы размечены по приоритету относительно нашей задачи, а не по «качеству» вообще. Приоритет обозначен и текстовым бейджем, и толщиной/стилем левой границы карточки — цвет никогда не единственный признак.

Приоритет 1

Прямо пригодно для модели on/off

Первичные T-клетки, есть экспрессия (или экспрессия + метилирование на тех же или сопоставимых образцах), координаты доступны на нашем окне CD55. Это то, на чём можно строить обучающую выборку уже сейчас.

Приоритет 2

Контекст, валидация, референс

Полезно как фон, для аннотации типов клеток, для проверки направления эффекта или как источник координат регуляторных элементов — но напрямую как пары «метилирование → экспрессия» не годится.

2. Главное: где есть парные метилирование + экспрессия

Для модели раздела 5 нужен не просто RNA-seq и не просто WGBS, а оба сигнала на одних и тех же (или максимально сопоставимых) клетках. Таких источников мало — вот они, честно с оговорками про то, насколько «те же» это образцы.

Источник Экспрессия Метилирование Те же образцы? Пригодность

«Те же образцы» — критический столбец: у BLUEPRINT метилом и транскриптом действительно сняты с одного отсортированного образца одного донора, у ENCODE — это разные эксперименты на разных донорах в рамках одного проекта и той же онтологии типа клеток.

3. Наборы данных по модальностям

Для каждого набора — что это, объём, accession-номера и почему это важно (или не важно) конкретно для CD55.

4. Чего в публичных данных нет

В духе принципа сайта — сначала честно перечислить, чего этот каталог не решает, прежде чем строить на нём модель.

Что это значит практически: публичные данные дают базовую линию «CD55 в нормальных T-клетках» — сколько метилирования и сколько экспрессии в невредактированных клетках, и как это меняется при активации. Этого достаточно, чтобы предобучить и отладить архитектуру модели раздела 5. Но обучающих примеров с CRISPRoff/ZFPoff-отредактированным CD55 в публичном доступе нет и быть не может — их даём только мы, и для этого всё равно нужен наш собственный парный RNA-seq по образцам Day 6 / Day 35 / K562.

5. Что с этим делать дальше

Конкретные шаги, вытекающие из каталога — в том же формате, что и Research Ideas/Todos.

Связанная страница

Foundation-модели: куда эти данные пойдут

Раздел 5 страницы Foundation-моделей описывает two-tower архитектуру «ДНК + метилирование → CD55 on/off». Именно её обучающая выборка собирается из наборов на этой странице — Приоритет 1 идёт в предобучение и отладку, наши собственные данные потом в fine-tuning.

Источники и порталы