Я Дима, программист студии «Контур». К нам пришёл клиент, который хочет обкатать нашу сборку на своём коде — но с жёстким NDA: ни одна строчка не должна уйти в облако. А локально у меня всего-то RTX 4060 с восемью гигабайтами видеопамяти. Ollama честно тянула маленькие модели, но стоило подсунуть ей нормальную MoE-шку — начиналось слайд-шоу. Я уже почти поверил, что «серьёзный ИИ без дата-центров» — сказка. Оказалось, нет.

Спас меня FreeToken — опенсорсный движок для запуска больших Mixture-of-Experts моделей на обычном потребительском железе. Лицензия Apache 2.0, репозиторий FlashML-org/FreeToken на GitHub. Разбираю, как я его поднял.
Шаг 1. Ставим
Одна команда:
uv pip install "freetoken[accel]"
Либо скачиваешь готовое десктопное приложение с flashml.ai. Поддерживаются видеокарты NVIDIA серий RTX 30, 40 и 50.
Шаг 2. Запускаем модель, которая «не влезает»
Фишка в том, что модель весит в разы больше видеопамяти — и это нормально. FreeToken не пытается запихнуть всё в GPU: он распределяет нагрузку между видеокартой, процессором и оперативкой, а шина PCIe становится частью конвейера. Поднимаю сервер одной строкой:
ft serve --model ~/models/Qwen3.6-35B-A3B
На моих 8 ГБ 35-миллиардная модель отвечает бодро, без «жди по букве». Для быстрого чата есть ft shell --model ... — движок и диалог в одном процессе.
Шаг 3. Подключаем агента
Сервер отдаёт наружу Anthropic/OpenAI-совместимый API. Это значит, что мой привычный Claude Code или Codex цепляется к локальному движку сменой одного адреса. Агент читает код клиента, а наружу не уходит ни байта — NDA соблюдено.
Шаг 4. Почему это вообще работает
Секрет не в магии, а в том, что GPU, CPU, RAM и PCIe работают как единая команда: движок непрерывно перекладывает вычисления и «экспертов» туда, где прямо сейчас есть свободный ресурс. Плюс Agent State Cache — он запоминает состояние и KV-кэш, так что повторные обращения и цепочки вызовов инструментов не пересчитываются с нуля.
По статье авторов (arXiv:2608.16157) FreeToken тянет 20+ MoE-моделей: 35B на ноутбучных 8 ГБ, 284B на игровом десктопе и даже 753B GLM-5.2 на одной рабочей станции. То есть железо, которое уже стоит у тебя на столе, теперь реально крутит frontier-модели.
Урок
Облачный API и аренда GPU в дата-центре больше не единственный путь. Есть клиентский код под NDA или просто хочется гонять агентов без лимитов и подписок — большая модель теперь живёт прямо у тебя. Достаточно того, что уже куплено.
Граница проходит не между «мощная машина» и «слабая машина», а между «жду, пока мне разрешат» и «собираю из того, что уже моё». — Архон