Я перестал помнить какие у меня агенты вообще есть. Собрал дашборд.
К концу апреля я не мог с ходу ответить, что у меня вообще автоматизировано. 12 публикаторов в кайт-школе, funnel-bot и remote-bridge, CRM-планировщик и sync в Google Sheets, routine VK Ads на claude.ai, 5 субагентов Claude Code (вспомогательных агентов, которых основной запускает под отдельную задачу), плюс MWB-генераторы. Десятки штук разнесены по 3 серверам. Сегодня я собрал один экран: agents.kulievvb.ru.
Контроль рассыпан, агентов больше чем памяти
Пока автоматизаций 5, ты помнишь их по именам. На 15 уже заводишь README с табличкой. А на 30+ этот README устаревает в тот же день, когда ты его дописал. Я ловил себя на том, что ssh-юсь в три сервера подряд, просто чтобы посмотреть, жив ли агент Х. Журнал доходов из CRM сегодня синкнулся? Funnel-bot ещё работает? Когда последний раз публиковался Дзен? И главное: какие агенты у меня вообще есть.
На рынке выбор такой: либо платные оркестраторы вроде n8n или Temporal, избыточные для одного человека, либо самодельные dashboards под конкретный стек, зашитые в один проект. Мне же нужно было нечто универсальное, что принимает события от любого агента на любом языке через один HTTP-вызов и складывает их в один экран.
Single-pane-of-glass на 44 агента
Каталог
44 агента из 4 проектов (Кайтек, Кайтек CRM, MWB, личное). У каждого свои name, project, kind, host, purpose, trigger. Источник истины один: YAML-файл, который синкается при старте.
События
started → finished/error, плюс produced для артефактов (TG-пост, VK-пост, sheet-row, отчёт). Артефактом я называю конкретный результат работы агента: ссылку на пост, строку в таблице, готовый файл. Приём событий идёт по HMAC-подписи, без аутентификации сессии.
Статусы
running / ok / idle / stale / error. Pills сверху каталога считают агентов в каждом состоянии, и сразу видно, что половина простаивает уже больше 2 дней.
Артефакты
Лента последних 20 «что произведено»: конкретные ссылки на TG-посты, VK-публикации, сгенерированные отчёты. Видно, куда пошла работа сегодня.
7-дневная статистика
На странице каждого агента видно, сколько раз он запускался за неделю, сколько было ошибок, и историю последних 50 запусков. Без графиков, цифрами.
Helper в 200 строк
report.py на stdlib, копируется в любой проект как один файл. Контекст-менеджер with reporter.run() сам шлёт started/finished, а при исключении отправляет error с traceback.
Минимум технологий, максимум изоляции
Хост. Тот же Timeweb-сервер (арендованный виртуальный, VPS), на котором уже крутится KiteTech CRM. Поднимать отдельную VPS под мониторинг бессмысленно, на CRM-сервере свободно 80% ресурсов. Правило одно: не трогать чужие контейнеры. Дашборд добавлен сервисом dashboard в существующий docker-compose.yml, рядом с CRM-стеком, на отдельном внутреннем порту 8077.
Стек. FastAPI + SQLAlchemy + Jinja2 + SQLite. Всё. SQLite держит до 100k событий без проблем — больше я физически не сделаю руками. Никаких Postgres, Redis, очередей.
TLS. Caddy уже стоял для CRM, дописал рядом блок agents.kulievvb.ru, и сертификат от Let's Encrypt выпустился через ACME за 6 секунд.
Безопасность. Basic Auth на UI (только я смотрю), HMAC SHA-256 на приёме событий (любой агент подписывает их своим секретом). Открытых endpoint'ов нет, сессий тоже, токены в куках не лежат.
Каталог оказался полезнее мониторинга
Когда агенты попали в один YAML с полем purpose, я наконец увидел, что половина из них дублируется по функции. Один TG-публикатор на VPS, второй на локалке, оба пишут в один и тот же канал, просто исторически собирались в разное время. Дашборд их не лечит, но показывает.
То же самое с триггерами. Часть агентов запускается через systemd, часть через cron, часть через Windows Task Scheduler, часть кликом в UI Claude Cloud. Когда я начал заполнять поле trigger, выяснилось, что я не помню, как некоторые из них вообще стартуют. Для владельца автоматизаций это самый неприятный диагноз.
Один файл, три строки кода
Helper report.py копируется в проект агента как обычный модуль. Никакого pip, никаких зависимостей кроме stdlib.
from report import Reporter
reporter = Reporter(
agent_id="my_project.thing",
secret=os.environ["AGENTS_DASHBOARD_HMAC"],
)
with reporter.run():
do_work()
reporter.produced(
type="tg_post",
url="https://t.me/...",
title="Пост 824",
)
Контекст-менеджер сам пошлёт started в начале и finished с exit_code=0 в конце. При исключении отправит error с последними 5 строками traceback и пробросит его дальше. Сетевые сбои проглатываются, так что агент не падает из-за того, что дашборд не ответил.
Первый агент по-настоящему подключён к дашборду
Шесть агентов news-pipeline (orchestrator, researcher-news, researcher-mwb, copy-editor, publishing-director, tg-publisher) рапортуют в дашборд каждый запуск. В каталоге видно, когда агент последний раз отрабатывал, что произвёл (этот пост попал в дашборд как артефакт news_post с url на kulievvb.ru/news/agents-dashboard/), и сколько раз сработал за неделю.
Когда что-то сломается, я увижу либо алерт в моём личном Telegram-чате (отдельный канал @MWBclub только для постов, ошибки идут отдельным DM), либо просто статус error в pills сверху дашборда. Пересборку пока запускаю вручную, но архитектура позволяет добавить webhook «retry» в v2.
Намеренные дыры
- Нет live SSE / websockets. Для одного пользователя перезагрузка страницы вполне годится.
- Нет кнопки «Run now». Это уже оркестратор, а не дашборд. Понадобится, вынесу отдельным сервисом.
- Нет графиков. Только числа. Графики начинают врать на small-N выборках.
- Нет multi-user. Один Basic Auth, никаких ролей.
- Нет pull-сборщика. Только push от агентов. Если агент молчит, он либо сломан, либо ничего не делает, и в обоих случаях это повод посмотреть.
-
Нет хранения логов. Только excerpt traceback в
error_text. Полный лог остаётся у самого агента.
Если у вас 10+ автоматизаций и вы не помните какие — мы построим вам такой же.
Это базовая инфраструктура для любого, у кого больше 5 ботов/cron-задач/n8n-flow в работе. Стоит дешевле потерянного времени на ssh по серверам.
Обсудить дашборд для своих агентов →