Геномные foundation-модели: Borzoi, AlphaGenome и путь к "секвенс-ту-функция" ИИ
Обзор современных моделей глубокого обучения, которые предсказывают функцию генома напрямую из последовательности ДНК — от Enformer и Borzoi до AlphaGenome — и разбор того, как их можно применить (и дообучить с учётом метилирования ДНК) в рамках проекта epicme.bio: CRISPRoff/ZFPoff-сайленсинг CD55, per-molecule Nanopore-метилирование и связь эпигенома с экспрессией.
1. Общая картина: от "предсказать один класс хроматина" до "предсказать весь RNA-seq трек"
За последние пять лет геномные foundation-модели прошли путь от классификаторов коротких мотивов до систем, которые берут сотни тысяч — миллион пар оснований ДНК и одним проходом предсказывают тысячи молекулярных дорожек: экспрессию, сплайсинг, полиаденилирование, доступность хроматина, связывание транскрипционных факторов.
| Модель | Разработчик | Год | Архитектура | Контекст | Выход |
|---|
Таблица — рабочий срез на август 2026; для активно развивающихся моделей (AlphaGenome, Evo2) параметры и доступность API могли измениться — сверяйтесь с первоисточниками ниже.
2. Модели подробно
Каждая карточка — архитектура, вход/выход, что модель фактически предсказывает и почему это может быть релевантно для локуса CD55.
3. Как это применимо к epicme.bio
Конкретные точки, где Borzoi/AlphaGenome и подобные модели могут усилить или проверить то, что уже есть на сайте (Day 6 / Day 35 CRISPRoff, ZFPoff K562, ChIP-seq deep-dive).
4. Дообучение на ДНК + сигнал метилирования
Ключевой пробел: Borzoi, AlphaGenome и Enformer принимают на вход только последовательность ДНК (плюс дискретный "тип клетки/трек" как выходной селектор). Они выучивают усреднённое по обучающей выборке эпигенетическое состояние для этого типа клеток, но не могут быть явно обусловлены на измеренное метилирование конкретной молекулы или образца.
4.1 Почему это ограничение важно именно для нашего проекта
Наш пайплайн Write → Read → Learn даёт ровно то, чего не хватает этим моделям на входе: per-molecule и per-CpG метилирование (Nanopore, EM-seq) в паре с известным статусом редактирования (CRISPRoff / ZFPoff / mock / unedited). Модель, дообученная так, чтобы явно принимать вектор метилирования как условие, в теории могла бы отвечать на контрфактические вопросы вида «что будет с экспрессией CD55, если именно этот CpG-кластер (#78–83) станет полностью метилированным» — а не только «какая экспрессия типична для этого типа клеток в среднем».
4.2 Архитектурные пути дообучения
4.3 Потенциальные результаты, если это сработает
5. Next: обучить модель ДНК + метилирование → CD55 «on/off» по RNA-seq
Конкретный, выполнимый следующий шаг: two-tower модель, которая объединяет (а) последовательность ДНК вокруг CD55 и (б) вектор метилирования по 137 CpG, чтобы предсказать бинарный/непрерывный статус гена по RNA-seq сигналу.
План действий
Валидация и честная отчётность
Leave-one-donor-out и leave-one-timepoint-out кросс-валидация (Day 6 и Day 35 сейчас — разные доноры, это нужно явно учитывать, а не путать эффект таймпоинта с эффектом донора — см. заметки K562/ChIP-seq страницы). Базовая линия сравнения — уже существующие metilation-only LR/RF модели (AUC 0.92–0.95 на LOW vs HIGH K562). Если добавление сырой ДНК-последовательности через предобученный Borzoi/Flashzoi backbone не улучшает эти метрики — это тоже честный и публикуемый результат, а не повод скрыть страницу.