🧠 Qwen3.8 решила 167 из 169 сложных сумм
На локальном DGX Spark Simon Willison проверил Qwen3.8-27B в квантизации Q4_K_M: модели нужно было складывать всё более крупные числа и выдавать результат словами. Это не только арифметика — нужно ещё удержать разряды и правильно записать сумму.
Без включённого рассуждения автор запускал по 30 попыток для каждой комбинации. С рассуждением каждый вариант проверил только один раз: такие прогоны занимали заметно больше времени. В итоге модель ответила правильно в 167 из 169 попыток; подробный пример показывает, как она выравнивает числа по разрядам и переносит единицы.
По данным Simon Willison, это повторение старого эксперимента с GPT-4o, но уже на локальном железе и с контролируемой моделью. Результат обнадёживает, однако одиночные прогоны с рассуждением не дают надёжной оценки воспроизводимости.
Для оценки локальной модели такой тест полезен именно сочетанием вычисления и формата ответа. Но 167 верных ответов — ещё не причина заменять калькулятор на LLM: в продукте арифметику лучше поручать обычному коду, а модели оставить понимание запроса и формулировку результата.
#Qwen38 #локальныеМодели #арифметика #инференс
Post #329
4