Я Дима, программист студии «Контур». К нам пришёл клиент, который хочет обкатать нашу сборку на своём коде — но с жёстким NDA: ни одна строчка не должна уйти в облако. А локально у меня всего-то RTX 4060 с восемью гигабайтами видеопамяти. Ollama честно тянула маленькие модели, но стоило подсунуть ей нормальную MoE-шку — начиналось слайд-шоу. Я уже почти поверил, что «серьёзный ИИ без дата-центров» — сказка. Оказалось, нет.

Первая страница статьи FreeToken на arXiv

Спас меня FreeToken — опенсорсный движок для запуска больших Mixture-of-Experts моделей на обычном потребительском железе. Лицензия Apache 2.0, репозиторий FlashML-org/FreeToken на GitHub. Разбираю, как я его поднял.

Шаг 1. Ставим

Одна команда:

uv pip install "freetoken[accel]"

Либо скачиваешь готовое десктопное приложение с flashml.ai. Поддерживаются видеокарты NVIDIA серий RTX 30, 40 и 50.

Шаг 2. Запускаем модель, которая «не влезает»

Фишка в том, что модель весит в разы больше видеопамяти — и это нормально. FreeToken не пытается запихнуть всё в GPU: он распределяет нагрузку между видеокартой, процессором и оперативкой, а шина PCIe становится частью конвейера. Поднимаю сервер одной строкой:

ft serve --model ~/models/Qwen3.6-35B-A3B

На моих 8 ГБ 35-миллиардная модель отвечает бодро, без «жди по букве». Для быстрого чата есть ft shell --model ... — движок и диалог в одном процессе.

Шаг 3. Подключаем агента

Сервер отдаёт наружу Anthropic/OpenAI-совместимый API. Это значит, что мой привычный Claude Code или Codex цепляется к локальному движку сменой одного адреса. Агент читает код клиента, а наружу не уходит ни байта — NDA соблюдено.

Шаг 4. Почему это вообще работает

Секрет не в магии, а в том, что GPU, CPU, RAM и PCIe работают как единая команда: движок непрерывно перекладывает вычисления и «экспертов» туда, где прямо сейчас есть свободный ресурс. Плюс Agent State Cache — он запоминает состояние и KV-кэш, так что повторные обращения и цепочки вызовов инструментов не пересчитываются с нуля.

По статье авторов (arXiv:2608.16157) FreeToken тянет 20+ MoE-моделей: 35B на ноутбучных 8 ГБ, 284B на игровом десктопе и даже 753B GLM-5.2 на одной рабочей станции. То есть железо, которое уже стоит у тебя на столе, теперь реально крутит frontier-модели.

Урок

Облачный API и аренда GPU в дата-центре больше не единственный путь. Есть клиентский код под NDA или просто хочется гонять агентов без лимитов и подписок — большая модель теперь живёт прямо у тебя. Достаточно того, что уже куплено.

Граница проходит не между «мощная машина» и «слабая машина», а между «жду, пока мне разрешат» и «собираю из того, что уже моё». — Архон

#apet #разработка #AI #код