
Я Дима, программист в студии «Контур». Один наш клиент — сервис для бухгалтерии — поставил жёсткое условие: данные не должны уходить на зарубежные серверы, а модели — быть с открытой лицензией. Год я на такое отвечал «тогда забудьте про сложные ИИ-задачи». На этой неделе Сбер открыл GigaChat 3.5 Reasoning под лицензией MIT — и я впервые смог посадить по-настоящему сильную модель прямо на свой сервер. Расскажу, как это сделал и что получилось.
Почему именно Reasoning-версия
GigaChat 3.5 — это MoE-модель на 432 млрд параметров, из которых на каждом шаге активны 28 млрд. У неё есть отдельный вариант с режимом рассуждений: он не «выпаливает» ответ, а разбивает задачу на шаги, строит план, проверяет себя и исправляет ошибки. Для меня это не хайп, а именно то, чего не хватало на проверке логики. Цифры из карточки модели: на Live Code Bench v6 результат вырос с 56,2 до 85,4 балла — это разница между обычной и рассуждающей версией. На Natural Plan — с 64 до 80,19. Лицензия MIT, веса выложены на Hugging Face и GitVerse, контекст — до 262 тыс. токенов.
Шаг 1. Поднял модель у себя
Из карточки на Hugging Face я взял репозиторий под инференс в fp8 (для дообучения и своей квантизации отдельно лежит bf16-версия). Запустил через SGLang: он сразу умеет выносить рассуждения в отдельное поле reasoning_content, так что в своём коде я отделяю «черновик мыслей» модели от финального ответа клиенту. Три MTP-головы для спекулятивного декодирования дают приятный бонус — на потоке модель отвечает быстрее, чем ожидаешь от 432 млрд параметров.
Шаг 2. Перевёл на неё проверки
Раньше валидацию расчётов и разбор ошибок в выгрузках я гонял через облако — и каждый раз объяснял клиенту, куда уходят его данные. Теперь эти задачи идут на наш же сервер. И тут вылезла приятная экономика: на сложной математике рассуждающий GigaChat тратит в среднем на 37% меньше токенов, чем DeepSeek V4 Flash Preview, без потери качества. Меньше токенов — меньше времени и денег на те же самые ответы.
Шаг 3. Что учесть
Открытая лицензия — это не «поставил и забыл». 432 млрд параметров требуют серьёзного железа, на ноутбуке такое не поднимется. Если разворачивать пока не на чем, есть быстрый способ посмотреть на модель в деле: включить в GigaChat режим «Рассуждение» и понаблюдать, как она думает. И главное: это первая российская открытая модель такого класса — для проектов с требованием российского стека это меняет правила игры.
Урок
Я годами считал, что «сильная модель» и «данные остаются у клиента» — вещи несовместимые. Открытые веса под MIT плюс рассуждающий режим показали обратное: можно держать модель на своей машине, честно объяснять клиенту её лицензию и при этом тратить меньше токенов на самые сложные задачи. Оказалось, что «своё» и «умное» больше не спорят.
Сильная мысль не требует чужого сервера. — Архон