Skip to content

Latest commit

 

History

History
77 lines (54 loc) · 8.46 KB

File metadata and controls

77 lines (54 loc) · 8.46 KB

EN | RU

О чём это

Мой текущий AI-сетап:

  • Asus GB10 - основной хост для LLM
  • китайский мини-ПК на Intel N95, где живёт агент Гермес
  • Synology NAS - docker-станция и хранилище
  • Macbook - рабочая машина

Такой расклад позволяет при желании вообще отключить LLM-хосту (Spark) интернет. На всякий случай.

TL;DR

  1. Claude Code заставляет локальный AI блестеть:
  • ставит и сопровождает окружение: софт, отладка проблем и т.д.
  • секреты не покидают LAN: в локальном Vaultwarden есть отдельная Organization, где боты хранят свои секреты (и Claude никогда не читает их в свой контекст!)
  • пишет скиллы для Гермеса и помогает ему, когда тот буксует.
  • у Claude жёсткие ограждения: никогда не читать ничего приватного/конфиденциального и немедленно сообщать об инцидентах (пара мелких была - см. PRIVACY.ru.md).
  1. Локальный AI почти всегда проигрывает передовым облачным моделям. Даже лучшие локальные LLM часто заваливают базовые задачи. НО схема, где Claude - недоверенный мозг, а локальная LLM - (глупый) доверенный исполнитель, на удивление эффективна!
  2. Speculative Decoding (MTP, DFlash и т.п.) - отстой. TPS (токены в секунду) поднимает, с чистой генерацией текста и кодом дружит, но на многих реальных агентских задачах подводит наглухо - см. журнал провалов.
  3. Агент Гермес отлично работает через Telegram и даёт всей семье почувствовать силу локального (доверенного) AI.

Самые ходовые юзкейсы:

  • учёт калорий - шлю Гермесу фото обеда, он считает белки и калории; текущие счётчики вижу на Android-виджете. Результат: минус 5 кг за 2 месяца! Обезличенные исходники: скилл skills/food-log/ и виджет-пайплайн skills/food-widget/.
  • спортивный мониторинг - 120+ параметров здоровья/сна/спорта с часов Garmin собираются в Home Assistant. После тренировки получаю полный разбор в Telegram. Бег уже заметно улучшился! Ощущение личного тренера.
  • личный врач - у Гермеса есть доступ к моим анализам крови, данным сна и ДНК.

Карта репозитория

  • spark/ - сама коробка: железо, headless-режим, swap против OOM, журнал провалов specdec, фикс KVM/HDMI, рецепты запуска
  • skills/ - обезличенные боевые скиллы: у локального агента food-log + пайплайн Android-виджета food-widget, у облачного копилота confidential-data-handling - его же гардрейлы; доки скиллов на английском - это язык рантайма агента
  • benchmarks/ - бейкоффы моделей на Spark
  • converters/ - утилиты квантизации
  • usecases/ - end-to-end примеры (разбор МРТ)
  • PRIVACY.ru.md - граница данных между облачным копилотом и локальным агентом

Железо

Asus Aspire GX10 (клон DGX Spark / GB10), теперь в основном headless - детали, swap/OOM и фиксы в spark/.

LLM

Текущий выбор (с 2026-07-18): Step-3.7-Flash

stepfun-ai/Step-3.7-Flash - 196B MoE, 11B активных, нативный vision. Крутится как GGUF IQ4_XS (~98 GiB) через llama.cpp в docker: ctx 262144, 2 параллельных слота, KV-кэш q4_0, ~28 tok/s тёплого декода на GB10.

Почему победил:

  • Vision-слои. Ежедневная агентская нагрузка мультимодальна; главная задача - учёт калорий по фото еды, и Step-3.7 читает тарелки и порции заметно лучше любого варианта Qwen3.6-27B, который тут гоняли.
  • MoE по размеру коробки. 11B активных параметров на memory-bound машине декодят ~3x быстрее плотной 27B, а полные 196B держат качество ответов.
  • Бенчмарки врут, прод - нет. Победитель бенча среди 27B-кандидатов провалил 2.5-часовой боевой прогон (повторял задачи, путал записи еды). Step-3.7 победил на реальной агентской работе. Полная история в benchmarks/.

Совет: держите served-model-name неизменным при смене моделей - прокси и конфиги агента не замечают подмены бэкенда.

План Б: Qwopus

Jackrong/Qwopus3.6-27B-v2-FP8 (дистилл Qwen3.6-27B на Opus-трейсах) через vLLM - предыдущая прод-модель и путь отката. Использовать авторский фикс chat template + --tool-call-parser hermes, --gpu-memory-utilization 0.60, без specdec (см. журнал провалов).

Прежние фавориты

  • Qwen3.6 27b NVFP4 + DFlash
  • Abliterated GPT-OSS-120b 1, 2 - быстрая на vLLM с полным контекстом (131k), детальные ответы уровня GPT4

Интересные модели

  • Dark Desires
  • CWC
    • любопытная медицинская модель с альтернативным взглядом на фарминдустрию (много аргументированной критики разных продуктов Big Pharma)

Границы приватности

Этот сетап обслуживают два AI: облачный копилот, который проектирует, дебажит и учит, и локальный агент, который трогает настоящие данные. Правило асимметрично намеренно: облачный никогда не читает секреты, чаты, данные здоровья и память агента - работает только со структурой, счётчиками и статусами. Полный контракт и инструменты его соблюдения: PRIVACY.ru.md.

Ссылки