EN | RU
Мой текущий AI-сетап:
- Asus GB10 - основной хост для LLM
- китайский мини-ПК на Intel N95, где живёт агент Гермес
- Synology NAS - docker-станция и хранилище
- Macbook - рабочая машина
Такой расклад позволяет при желании вообще отключить LLM-хосту (Spark) интернет. На всякий случай.
- Claude Code заставляет локальный AI блестеть:
- ставит и сопровождает окружение: софт, отладка проблем и т.д.
- секреты не покидают LAN: в локальном Vaultwarden есть отдельная Organization, где боты хранят свои секреты (и Claude никогда не читает их в свой контекст!)
- пишет скиллы для Гермеса и помогает ему, когда тот буксует.
- у Claude жёсткие ограждения: никогда не читать ничего приватного/конфиденциального и немедленно сообщать об инцидентах (пара мелких была - см. PRIVACY.ru.md).
- Локальный AI почти всегда проигрывает передовым облачным моделям. Даже лучшие локальные LLM часто заваливают базовые задачи. НО схема, где Claude - недоверенный мозг, а локальная LLM - (глупый) доверенный исполнитель, на удивление эффективна!
- Speculative Decoding (MTP, DFlash и т.п.) - отстой. TPS (токены в секунду) поднимает, с чистой генерацией текста и кодом дружит, но на многих реальных агентских задачах подводит наглухо - см. журнал провалов.
- Агент Гермес отлично работает через Telegram и даёт всей семье почувствовать силу локального (доверенного) AI.
- учёт калорий - шлю Гермесу фото обеда, он считает белки и калории; текущие счётчики вижу на Android-виджете. Результат: минус 5 кг за 2 месяца! Обезличенные исходники: скилл
skills/food-log/и виджет-пайплайнskills/food-widget/. - спортивный мониторинг - 120+ параметров здоровья/сна/спорта с часов Garmin собираются в Home Assistant. После тренировки получаю полный разбор в Telegram. Бег уже заметно улучшился! Ощущение личного тренера.
- личный врач - у Гермеса есть доступ к моим анализам крови, данным сна и ДНК.
spark/- сама коробка: железо, headless-режим, swap против OOM, журнал провалов specdec, фикс KVM/HDMI, рецепты запускаskills/- обезличенные боевые скиллы: у локального агентаfood-log+ пайплайн Android-виджетаfood-widget, у облачного копилотаconfidential-data-handling- его же гардрейлы; доки скиллов на английском - это язык рантайма агентаbenchmarks/- бейкоффы моделей на Sparkconverters/- утилиты квантизацииusecases/- end-to-end примеры (разбор МРТ)PRIVACY.ru.md- граница данных между облачным копилотом и локальным агентом
Asus Aspire GX10 (клон DGX Spark / GB10), теперь в основном headless - детали, swap/OOM и фиксы в spark/.
stepfun-ai/Step-3.7-Flash - 196B MoE, 11B активных, нативный vision. Крутится как GGUF IQ4_XS (~98 GiB) через llama.cpp в docker: ctx 262144, 2 параллельных слота, KV-кэш q4_0, ~28 tok/s тёплого декода на GB10.
Почему победил:
- Vision-слои. Ежедневная агентская нагрузка мультимодальна; главная задача - учёт калорий по фото еды, и Step-3.7 читает тарелки и порции заметно лучше любого варианта Qwen3.6-27B, который тут гоняли.
- MoE по размеру коробки. 11B активных параметров на memory-bound машине декодят ~3x быстрее плотной 27B, а полные 196B держат качество ответов.
- Бенчмарки врут, прод - нет. Победитель бенча среди 27B-кандидатов провалил 2.5-часовой боевой прогон (повторял задачи, путал записи еды). Step-3.7 победил на реальной агентской работе. Полная история в
benchmarks/.
Совет: держите served-model-name неизменным при смене моделей - прокси и конфиги агента не замечают подмены бэкенда.
Jackrong/Qwopus3.6-27B-v2-FP8 (дистилл Qwen3.6-27B на Opus-трейсах) через vLLM - предыдущая прод-модель и путь отката. Использовать авторский фикс chat template + --tool-call-parser hermes, --gpu-memory-utilization 0.60, без specdec (см. журнал провалов).
- Qwen3.6 27b NVFP4 + DFlash
- Abliterated GPT-OSS-120b 1, 2 - быстрая на vLLM с полным контекстом (131k), детальные ответы уровня GPT4
- Dark Desires
- CWC
- любопытная медицинская модель с альтернативным взглядом на фарминдустрию (много аргументированной критики разных продуктов Big Pharma)
Этот сетап обслуживают два AI: облачный копилот, который проектирует, дебажит и учит, и локальный агент, который трогает настоящие данные. Правило асимметрично намеренно: облачный никогда не читает секреты, чаты, данные здоровья и память агента - работает только со структурой, счётчиками и статусами. Полный контракт и инструменты его соблюдения: PRIVACY.ru.md.
- Форум Nvidia https://forums.developer.nvidia.com/c/accelerated-computing/dgx-spark-gb10/dgx-spark-gb10/721
- Reddit-сообщества localLLM https://www.reddit.com/r/LocalLLM/ https://www.reddit.com/r/LocalLLaMA/
- Хорошие youtube-видео https://www.youtube.com/channel/UCajiMK_CY9icRhLepS8_3ug
- Бенчмарки моделей на Spark https://spark-arena.com/leaderboard