3 миллиарда строк кода, в которых вы еще не копались
Самый плотный датасет в природе умещается в ядре одной клетки. Четыре буквы ДНК (A, T, G, C) составляют последовательности, из которых собрана инструкция по сборке целого человека. Первый геном секвенировали в начале 2000-х, на это потратили 13 лет и почти 3 миллиарда долларов. Сегодня можно ограничиться парой месяцев и суммой до 7 тыс.
После расшифровки начинается работа, очень похожая на то, чем занимаются модели: искать корреляции между конкретными вариациями (SNP) и признаками — предрасположенностью к заболеваниям, реакцией на лекарства, особенностями метаболизма. Биоинформатика по сути является разновидностью ML, только обучающая выборка состоит из миллионов геномов, а признаками служат нуклеотиды.
Такой разбор на нули и единицы теперь доступен каждому. Например, «Генетический паспорт» от Genotek — это ДНК-тест, который раскладывает геном на выводы и рекомендации по здоровью: он показывает риски по 187 заболеваниям, побочные реакции на препараты, алкоголь, аллергии и дефициты витаминов. Он также определяет этнический состав и людей с совпадающими участками ДНК (родственников). Что интересно: помимо отчета, сырые данные выдаются файлом, который можно использовать самостоятельно.
Промо
RETRANSLATOR2 дает скидку 72% на расшифровку собственного кода. Заказывайте свой генетический паспорт здесь.

