TGViewer
MedData Lab MedData Lab @meddatalab · 391 subscribers
Post #93 262
R_start_script.R2 KB
Почему R..?

В Excel меня долго устраивало почти всё.

Можно отфильтровать нужные строки, посчитать показатели, собрать таблицу, быстро что-то поправить вручную.

Но в какой-то момент появляется очень простой вопрос:
а как именно была получена эта цифра?

Какие строки мы исключили?
Что сделали с пропусками?
По какому принципу сформировали группы?
Не возник ли на каком-то этапе анализа артефакт?

Если было несколько фильтраций, промежуточных таблиц и правок, спустя время восстановить всю цепочку бывает уже непросто.

Наверное, поэтому уже много лет для анализа данных я использую именно R.

Анализ остаётся записанным в скрипте — шаг за шагом.
Загрузили данные:
dat <- read.csv("data.csv")

Проверили:
str(dat)
summary(dat)

Проверили пропуски:
sum(is.na(dat))

Описали группы:
dat %>%
group_by(group) %>%
summarise(
n = sum(!is.na(marker)),
mean = mean(marker, na.rm = TRUE),
sd = sd(marker, na.rm = TRUE)
)

Построили график:
ggplot(dat, aes(group, marker)) +
geom_boxplot() +
geom_jitter(width = 0.1)

Сравнили группы:
t.test(marker ~ group, data = dat)

Через месяц можно открыть скрипт и увидеть, что именно было сделано. Через год — повторить анализ. Передать его коллеге. Запустить тот же код на обновлённых данных.

Это и есть одна из основ воспроизводимого анализа.

И для меня здесь важно ещё одно: код фиксирует не только расчёты, но и аналитические решения.

Какую выборку мы анализируем?
Что делаем с пропусками?
Какие группы сравниваем?
Какой метод используем?

R не решает эти вопросы за исследователя и не делает анализ автоматически правильным. Но все эти решения становятся видимыми — их можно проверить, обсудить и при необходимости изменить.

В итоге R для меня — это не столько «программирование», сколько способ записать логику анализа.

И чтобы этот пост не остался только рассуждением, я подготовила небольшой файл:
«С чего начать анализ новой таблицы в R: минимальный рабочий шаблон»
Внутри — простой каркас:
загрузка данных → первичная проверка → пропуски → описание групп → визуализация → статистический тест.
Его можно скачать, открыть в RStudio и адаптировать под свою таблицу.

А на курсе мы идём дальше по той же логике: от исходной таблицы и подготовки данных до статистического анализа, визуализации в ggplot2 и интерпретации результатов.
Старт нового потока — 31 августа.
  • ❤ 5
  • 🔥 5
  • 👍 3
  • 🤩 1
  • 👌 1
  • 🤓 1
More from @meddatalab
  1. Sep 21, 2026Вернёмся к голосовалке из прошлого поста. Напомню условие: исследование сравнивало два мет…
  2. Sep 16, 2026Я снова студент 😏 Теперь — магистратуры ВШЭ. Так что посты могут иногда выходить чуть реж…
  3. Sep 10, 2026Post #106
  4. Sep 10, 2026p = 0,2. Значит, эффекта нет? Наверняка вы встречали в статьях что-то вроде: «Статистическ…
  5. Sep 3, 2026Когда данные слишком красивые В конце августа 2011 года трое молодых исследователей из Til…
  6. Aug 31, 2026Почему не каждую переменную нужно включать в модель: конфаундер vs коллайдер Когда мы стро…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →