Генеративный ИИ может «изобрести» несуществующие биологические открытия

Система искусственного интеллекта может помочь ученым определить новый многообещающий препарат. Но он также может убедить их в том, что биологический эффект существует, хотя его нет.
Генераторный ИИ создает новый контент, изучая общие черты и взаимосвязи на существующих примерах.
Хотя эта технология наиболее известна благодаря созданию текста и изображений, исследователи изучают возможность ее использования при разработке белков, моделировании клеток, заполнении пробелов в экспериментальных результатах и создании синтетических биологических данных.
Но эти системы могут галлюцинировать.
В биологических исследованиях это может означать создание правдоподобной молекулярной структуры или вывода, который не отражает основную биологию.
Такая ошибка может иметь ощутимые последствия.
ИИ может игнорировать кандидатный препарат, который мог бы сработать, направить исследователей к неэффективному лечению, скрыть подлинный биологический эффект или выставить несуществующий механизм болезни открытием.
Вычислительный биолог Томас Бургер из Университета Гренобль-Альпы во Франции исследует эту проблему на примере 10 потенциальных применений генеративного ИИ в статье Opinion, опубликованной в журнале Patterns.

Эксперименты Omics могут генерировать обширные наборы данных, содержащие измерения генов, белков и других молекул. ИИ мог бы помочь исследователям разобраться в этом огромном объеме информации, но тонкие изменения, вносимые в такие сложные данные, может быть трудно обнаружить.
Бюргер предполагает, что не все эти приложения несут одинаковый уровень риска.
Ключевое различие заключается в том, являются ли результаты ИИ идеей, которая позже будет проверена в реальном эксперименте, или синтетическими данными, используемыми непосредственно в качестве доказательства.
«Я никогда не задумывался об этом до сих пор, но думаю, что галлюцинации могут привести к подлинным открытиям». – вычислительный биолог Томас Бургер
Проверка потенциальных лекарств или белков относится к числу приложений со сравнительно низким риском. Модель может быстро оценить большое количество кандидатов и выбрать меньшую группу для лабораторных испытаний.
Если ИИ допустит ошибку, исследователи могут отбросить кандидата, который мог бы сработать, или потратить время и деньги на исследование того, который в конечном итоге потерпит неудачу. Но выбранному кандидату все равно придется продемонстрировать свои эффекты в реальном эксперименте, прежде чем его признают открытием.
Опасность возрастает, когда данные, сгенерированные ИИ, начинают заменять экспериментальные измерения.
Синтетические биологические данные могут помочь заполнить недостающие измерения, защитить конфиденциальность пациентов, создать группы сравнения, снизить затраты на исследования или уменьшить количество животных, используемых в экспериментах.
Но если ИИ добавит особенность, которой никогда не было, ученые могут поверить, что открыли биологический эффект, которого никогда не было. Система больше не будет делать только неправильные прогнозы об эксперименте. Его изготовление стало бы доказательством, подтверждающим научное утверждение.
«В большинстве случаев проблема не в том, чтобы сравнить галлюцинацию и подлинное биологическое открытие», — сказал Бургер ScienceAlert.
— Речь идет скорее о том, что реальные данные были искажены галлюцинациями в ходе сложного вычислительного (с помощью генИИ) рабочего процесса, который позволяет превращать необработанные сигналы, полученные с помощью сложных биотехнологий, в биологически достоверные описания молекулярных механизмов».
Другими словами, обрабатывая подлинные данные, ИИ может изменить сигнал таким образом, что его будет трудно обнаружить. Это изменение может повлиять на вывод исследователей, не создавая отдельных, явно сфабрикованных результатов.
«Если в ходе процесса некоторые сигналы искажаются, усиливаются или изменяются в любом направлении, что может привести к различным окончательным биологическим выводам, исследователю будет сложно это заметить, если он не имеет глубокого понимания того, как работает генИИ», — сказал Бургер.
Реальный пример появился с AlphaFold. 3.
В статье, опубликованной в журнале Nature в 2024 году, разработчики AlphaFold 3 сообщили, что модель может генерировать «галлюцинированные структуры» в неупорядоченных участках белка, хотя низкие показатели достоверности могут предупредить исследователей об этой проблеме.
Ошибки ИИ не всегда могут сделать несуществующий эффект реальным. Вместо этого модель может так сильно искажать данные, что исследователи упускают из виду реальный эффект, потенциально упуская доказательства того, что лечение действительно работает.
Бергер ранее не задумывался о том, может ли галлюцинация ИИ привести к настоящему открытию.
«Я никогда не думал об этом до сих пор, но я думаю, что галлюцинации могут привести к подлинным открытиям».
Он сравнил эту возможность с неожиданными открытиями, возникающими в результате лабораторных ошибок.
«Интуиция уже давно существует. было признано; в конечном итоге это не имеет значения, как с моральной точки зрения, так и с ожидаемого уровня последующей проверки», — сказал Бергер.
Важно то, как исследователи используют результаты. Если к галлюцинации относиться как к идее, которую нужно проверить, она может остаться всего лишь неудавшейся гипотезой. Если рассматривать это как подлинное наблюдение, убедительная выдумка может стать доказательством и быть ошибочно принята за биологическую реальность.
Даже самый захватывающий результат, предложенный ИИ, не является открытием, пока он не будет независимо проверен в реальном эксперименте.
Статья опубликована в журнале Patterns.














