В Excel меня долго устраивало почти всё.
Можно отфильтровать нужные строки, посчитать показатели, собрать таблицу, быстро что-то поправить вручную.
Но в какой-то момент появляется очень простой вопрос:
а как именно была получена эта цифра?
Какие строки мы исключили?
Что сделали с пропусками?
По какому принципу сформировали группы?
Не возник ли на каком-то этапе анализа артефакт?
Если было несколько фильтраций, промежуточных таблиц и правок, спустя время восстановить всю цепочку бывает уже непросто.
Наверное, поэтому уже много лет для анализа данных я использую именно R.
Анализ остаётся записанным в скрипте — шаг за шагом.
Загрузили данные:
dat <- read.csv("data.csv")Проверили:
str(dat)
summary(dat)
Проверили пропуски:
sum(is.na(dat))
Описали группы:
dat %>%
group_by(group) %>%
summarise(
n = sum(!is.na(marker)),
mean = mean(marker, na.rm = TRUE),
sd = sd(marker, na.rm = TRUE)
)
Построили график:
ggplot(dat, aes(group, marker)) +
geom_boxplot() +
geom_jitter(width = 0.1)
Сравнили группы:
t.test(marker ~ group, data = dat)
Через месяц можно открыть скрипт и увидеть, что именно было сделано. Через год — повторить анализ. Передать его коллеге. Запустить тот же код на обновлённых данных.
Это и есть одна из основ воспроизводимого анализа.
И для меня здесь важно ещё одно: код фиксирует не только расчёты, но и аналитические решения.
Какую выборку мы анализируем?
Что делаем с пропусками?
Какие группы сравниваем?
Какой метод используем?
R не решает эти вопросы за исследователя и не делает анализ автоматически правильным. Но все эти решения становятся видимыми — их можно проверить, обсудить и при необходимости изменить.
В итоге R для меня — это не столько «программирование», сколько способ записать логику анализа.
И чтобы этот пост не остался только рассуждением, я подготовила небольшой файл:
«С чего начать анализ новой таблицы в R: минимальный рабочий шаблон»
Внутри — простой каркас:
загрузка данных → первичная проверка → пропуски → описание групп → визуализация → статистический тест.
Его можно скачать, открыть в RStudio и адаптировать под свою таблицу.
А на курсе мы идём дальше по той же логике: от исходной таблицы и подготовки данных до статистического анализа, визуализации в ggplot2 и интерпретации результатов.
Старт нового потока — 31 августа.