Он разрабатывает ClawBio - репозиторий биологических агентов для LLM. Если сильно упростить, это просто набор текстовых инструкций к онлайн сервисам, ссылку на которые можно дать GPT - тогда модель сможет обращаться к этим сервисам при решении биологических задач.
Поскольку коллеги из GI сделали API к нашей моделе для предсказания экспрессии, решил добавить этот API как инструкцию к ClawBio и протестировать. В общем сделал так: запустил Codex от ChatGPT и попросил (просто текстом, без кода) предсказать экспрессию для парочки промоторов в кроветворных и печеночных клетках. Работает! GPT понимает, что сам такое сделать не сможет, но у него есть инструкция как запустить стороннюю модель - он дергает за нее, получает предсказание и обсуждает со мной.
Ок. Дальше попросил GPT сделать мутагенез последовательности промтора гемоглобина - написал такой промпт:
Now I want you to modify this sequence to optimize expression in HepG2.
Do this greedy:
- introduce a random mutation
- benchmark it with the GI expression model
- if it increases expression in HepG2, keep it
- otherwise discard it
Your aim is maximum HepG2 expression.
Report the best sequence and number of mutations it has compared to the reference sequence.
GPT сам написал мне скриптик для этой задачи, который обращается к нашей модели экспрессии, и за 50+ мутаций сделал из промотора гемоглобина что-то, активное (по крайней мере модель так считает) в гепатоцитах!
В общем пока что сами биомодели остаются бутылочным горлышком - например, у них у всех (включая наши) не очень хорошо с клеточной специфичностью предсказаний. Но модели постепенно совершенствуются - а инфраструктура для них уже есть.
П.С. Полная версия поста про мои упражнения с ClawBio