Читай-Китай

🧬 Клетку моделируют в компьютере — деньги пришли раньше доказательств

Около 1999 года выдуманную бактерию со 127 генами вручную вписали в компьютер, уравнение за уравнением, и она прошла цикл деления в цифре. Теперь очередь человеческой клетки с десятками тысяч генов, только правила модель выучивает сама. С апреля 2026 года китайская база «Дунмайчэн» (动脉橙) насчитала почти десять сделок, раскрытые суммы — до 200 с лишним млн юаней. А лучшие модели пока предсказывают отдельные реакции клетки, но не воспроизводят её целиком.

Восемь сделок показывают, за что платит капитал

Самый крупный получатель — Xellar Biosystems: более 200 млн юаней в раунде A в апреле и ещё около 200 млн в A+ в июне. Компания изучает сочетание органоидных чипов, трёхмерной съёмки клеток и ИИ: цифровой прогноз можно проверять физическим экспериментом. Среди инвесторов были Legend Capital, XtalPi и государственные фонды.

Остальные события:

Vitaura строит платформу для поиска мишеней, скрининга препаратов и дифференцировки стволовых клеток (iPSC). INFevo моделирует уровни от молекулы до клетки и ищет применение в синтетической биологии. GENESIGHT сосредоточена на доклинической оценке эффективности, а DeepCellX начинает с молекулярных взаимодействий. Деньги выдаются на ранней стадии; компании пока различаются прежде всего сценариями применения.

От 127 генов к моделям человеческой клетки

Первая волна была механистической. В E-Cell, начатом примерно в 1999 году, исследователи вручную записывали уравнения и параметры гипотетической бактерии со 127 генами. Этого хватило для цифрового цикла деления, но каждый новый ген и реакция требовали ручной работы. Масштабирование упиралось в число параметров и труд исследователей.

В 2012 году полная модель Mycoplasma genitalium охватила 482 гена: моделировала рост и деление бактерии, предсказывала эффект выключения генов. Но она не переносилась на сложные клетки, часть параметров нельзя было точно измерить, а массовая лабораторная проверка оставалась недоступной.

Третья волна 2025–2026 годов меняет объект и метод. Вместо сотен бактериальных генов — человеческие клетки с десятками тысяч генов; вместо заданных правил — обучение на одноклеточном секвенировании и массовых опытах с воздействием на клетки. После предобучения модель настраивают предсказывать ответ на выключение гена или препарат. Узким местом стали качество данных, динамические измерения и экспериментальный замкнутый цикл.

Тесты улучшаются быстрее лабораторных доказательств

Масштаб ожиданий задала Xaira Therapeutics: созданная в 2024 году компания сразу привлекла $1 млрд — редкую сумму для раннего биотеха. В 2023 году GeneCompass обучали на более чем 120 млн клеток человека и мыши, а GenBio AI выпустила AIDO.Cell-100M класса 100 млн параметров. В июне 2024-го появились scFoundation на 100 млн параметров от BioMap и Университета Цинхуа, а также CD-GPT от Tencent AI Lab.

В 2025 году Arc Institute представил STATE на 170 млн клеток и набор Tahoe-100M объёмом более 100 млн клеток. ProteinTalks команды Го Тяньнаня использовал 38 млн записей о белковых возмущениях. В 2026-м CellVQ опирался на 68 млн клеток, для CellOS компании Vitaura в таблице указан масштаб 390,5 млн, UniPert-G2CP использовал 82 млн пар «возмущение—ответ». Модель Alibaba DAMO Academy охватывает 18 тыс. генов.

X-Cell компании Xaira Therapeutics с 4,9 млрд параметров на Tahoe-100M получила коэффициент Пирсона 0,31 против 0,22 у STATE; по отдельным показателям преимущество доходило до пяти раз. Чем коэффициент ближе к 1, тем точнее прогноз совпадает с экспериментом, но результат на одном наборе не равен воспроизведению живой клетки и тем более успешному лекарству.

xTrimo от BioMap выросла до 268 млрд параметров, а модель клеточных возмущений xTrimo SCPerturb стала первой среди более чем 1200 команд соревнования 2025 года. В 2026-м модель Alibaba DAMO Academy победила среди 25 команд. Tencent соединяет исследования с долей в XtalPi, которая инкубировала INFevo и инвестировала в Xellar Biosystems. Конкурируют уже экосистемы данных, лабораторий и капитала.

Что это значит

Виртуальная клетка сегодня — не полный цифровой двойник живой клетки. По оценке основателя Westlake Omics Го Тяньнаня, многие системы решают узкую задачу: по текущему состоянию клетки прогнозируют последствия выключения гена или обработки препаратом. До полноценного проигрывания жизни клетки далеко, поэтому число параметров и место в соревновании следует читать как промежуточные метрики.

Главное ограничение — данные. В открытых наборах много статических наблюдений, но мало качественных пространственных, временных данных и данных о воздействиях на клетки. Основатель MobiDrop Пэй Хао указывает и на систематические различия между сериями из разных лабораторий, приборов и протоколов, а также неполное описание образцов. Корреляционная модель на такой основе может показать хороший результат в тесте и не объяснить механизм.

Рынок финансирует не замену эксперимента, а контур «данные — прогноз — лабораторный эксперимент — новая итерация». По словам CTO GENESIGHT Ван Исюань, ценность модели нужно проверять в реальных задачах вместе с врачами, учёными и фармкомпаниями; до этого почти десять раундов остаются авансом. Инвестиционная гонка уже началась, но лидера определит не лучший тест, а результат, который выдержит лабораторию.

По материалам 36Kr, Ван Шивэй, 19 августа 2026.
По теме:Полупроводники и памятьИскусственный интеллект в КитаеТехнологииЭкономика и бизнесНаука

Каждый день — 4–5 разборов из китайской прессы. Без рекламы и воды.

Читать в Telegram