Перейти к содержимому

ИИ для аналитики данных: скрипты, графики и отчёты с агентами

Разработчик Хади Джавед из компании RevelAI описал в мае 2026 года, как собрал и открыл Byaan — «маленького ИИ-аналитика, который работает рядом с вашей базой и отвечает на длинный хвост вопросов вида “можешь быстро вытащить вот это?”» (пост в блоге). Причина прозаичная: команда customer success постоянно дёргала инженеров с разовыми запросами, а дашборды такие вопросы не закрывают. Дальше он называет грабли, знакомые любому аналитику: «Модель редко была узким местом. Узким местом была обвязка вокруг модели». Разбираю, что из этого применимо к рабочему процессу аналитика с кодинг-агентом.

Пост Хади Джаведа о Byaan
Скриншот поста «Open Sourcing Byaan, Your Company’s AI Data Analyst» на hadijaveed.me. Снято 10.09.2026.
Репозиторий byaan-ai/byaan на GitHub
Скриншот открытого репозитория github.com/byaan-ai/byaan: структура кода, лицензия MIT. Снято 10.09.2026.

Почему «подключить ИИ к базе» не работает

Джавед разбирает два популярных подхода и объясняет, почему оба разваливаются. Готовые cloud-аналитики (Julius, Hex и подобные): для компании на 20-50 человек они «слишком тяжёлые» и требуют отдать третьей стороне широкий доступ к продакшену. Второй вариант — «направить Claude Code на базу»: безопасность («просить агента “пожалуйста, не делай DROP TABLE” — это не настоящий слой защиты») плюс прозрачность (CLI годится инженеру, но не сотруднику поддержки).

Его вывод перекликается с разбором на vc.ru: «ИИ знает о структуре ваших таблиц, но это не помогает автоматизировать вашу аналитику». Автор делит знание о данных на три уровня — структура, lineage и бизнес-семантика. Большинство ассистентов застревают на первом: information_schema даёт синтаксис, но не отвечает, почему amount считается без НДС, а total_amount с НДС.

Поэтому в основе Byaan лежит память: агент «учит вашу схему, ваши джойны, определения метрик и ошибки, которые он сделал вчера». Это и есть harness — обвязка, а не модель.

Цепочка анализа с агентом

Практический процесс для аналитика состоит из семи шагов. Это не про «топ нейросетей для данных», а про порядок работы: постановка вопроса, разведка, расчёт, визуализация, проверка, отчёт, воспроизводимость.

Схема: цепочка анализа с агентом
Собственная схема рабочего процесса аналитика с кодинг-агентом.

Центральный принцип — скрипт живёт в git, а не в чате. Расчёт, сделанный прямо в переписке с агентом, нельзя перезапустить через месяц и нельзя отревьюить. Тот же расчёт файлом в репозитории воспроизводим и прогоняется заново на свежих данных.

Таблица: задача / как ставим агенту / как проверяем

Задача Как ставим агенту Как проверяем результат
Разведка CSV «Покажи схему, типы, пропуски, выбросы» df.info(), df.describe(), ручная сверка числа строк
Расчёт метрики «Посчитай retention по когортам за квартал» пересчёт вторым способом (pandas против SQL)
Сложный SQL «Напиши запрос на duckdb по этой схеме» EXPLAIN, сверка с промежуточной выгрузкой
Визуализация «Построй график выручки по месяцам» глазами: масштаб, подписи, единицы
Поиск аномалий «Найди аномалии в этой колонке» подтверждение конкретных выбросов вручную
Отчёт «Собери выводы в markdown с цифрами» каждая цифра сверена с расчётом
Воспроизводимость «Оформи как скрипт в scripts/» запуск с чистого окружения

Смотрите на колонку проверки. Агент почти никогда не ошибается в синтаксисе — pandas-код запускается с первого раза. Он ошибается в логике: берёт не ту колонку, неверно понимает определение метрики, делает поспешную корреляцию. Поэтому проверка смещена в сторону смысла, а не компиляции.

Пример: разведка CSV и первые графики

Покажу рабочий цикл на промпте, который даёт агенту узкую задачу вместо расплывчатого «проанализируй данные»:

Ты — аналитик данных. У тебя файл sales.csv с колонками:
date, region, product, revenue, units.
1. Покажи схему: типы колонок, число строк, пропуски по колонкам.
2. Выведи выбросы в revenue методом IQR, не удаляй их — только перечисли.
3. Построй график суммарной выручки по месяцам (matplotlib, сохрани в fig-revenue.png).
4. В выводе к графику укажи, есть ли месяцы с неполными данными,
   прежде чем делать заключение о тренде.
Не переходи к следующему шагу, пока не покажешь результат предыдущего.

Ключевые требования — «не удаляй, только перечисли» и «проверь полноту данных перед выводом о тренде». Первое защищает от молчаливой потери выбросов, второе — от ошибки, когда неполный последний месяц принимают за падение. Инструменты обычные: pandas для таблиц, duckdb для SQL поверх CSV без сервера, matplotlib или plotly для графиков, Jupyter для разведки.

Нюанс приватности: Джавед описывает, что Byaan отдаёт только результаты запросов и контекст схемы, а соединение с базой остаётся на вашей инфраструктуре. В связке «локальный агент + CSV в репозитории» вы контролируете это полностью: файл читается с диска, наружу уходит только то, что вы сами отправите.

Где агент врёт

Самая опасная ошибка агента в аналитике — не падение скрипта, а уверенный неверный вывод по верно посчитанному графику. Показательный сюжет: агент видит рост выручки до апреля и спад к июню и пишет «спрос упал». А на деле в мае подняли цены, и спад — следствие ценового решения, а не спроса. Данные на графике верные, вывод — ложный.

Схема: верный график и ложный вывод агента
Собственная схема: типичный разрыв между корректной визуализацией и ошибочной интерпретацией.

Русскоязычный практик на vc.ru описывает ту же проблему со стороны бизнеса: «цифры всегда перепроверяю, иногда выдумывает уверенным тоном» (пост про 7 направлений, отданных ИИ). Что делать технически:

  • Корреляция — не причина. Запретите агенту писать «X влияет на Y» без подтверждения. «X и Y меняются вместе» безопаснее.
  • Считайте одну метрику двумя способами. Если retention из pandas совпал с retention из SQL — доверия больше.
  • Проверяйте полноту данных перед трендом. Неполный период — частая причина ложного «падения».
  • Держите единицы явными. Агент легко складывает рубли с тысячами рублей, если в колонках нет суффикса.

Воспроизводимость и ревью

Логичное продолжение — превратить разовую разведку в проверяемый артефакт. Практика Джаведа ровно про это: «корректировка становится частью системы». В терминах репозитория:

# структура, к которой стоит стремиться
analysis/
  scripts/
    load.py         # чтение и типизация
    metrics.py      # определения метрик (retention, ARPU)
    plots.py        # графики с фиксированными осями
  reports/
    q3-growth.md    # отчёт со ссылками на скрипты
  tests/
    test_metrics.py # проверка на эталонных данных

Почему это важно именно с агентом. Агент пишет код быстро, но не помнит прошлые сессии: без файлов он каждую неделю заново гадает, что значит «активный клиент». Когда определение метрики лежит в metrics.py, а разбор ошибок — в тестах, поведение агента стабильно. Это тот же принцип, что и тесты с pytest: сначала зафиксируйте ожидаемое, потом просите агента его достичь. Как это выглядит у больших команд — видно по каталогу GetCassis/analytics-agent-articles с разборами от data-команд: общая линия у всех — сначала контекст и метрики, потом агент.

Российские реалии

Чем это делать без зарубежных подписок. Ключевое преимущество аналитической задачи в том, что она не требует топовых моделей: pandas, duckdb, matplotlib и Jupyter — свободные и бесплатные, ставятся из pip или репозиториев дистрибутива. Кодинг-агент можно взять open-source (Cline, ZooCode в VS Code, Aider в терминале) и подключить к локальной модели через Ollama или LM Studio — код и данные не покидают машину, платить за токены не нужно.

Железо. Для локальной модели на 7-14 млрд параметров достаточно 16-32 ГБ оперативной памяти; ускорение на GPU заметно, но для разового анализа CSV хватает и процессора.

Оплата облачных агентов. Если всё же нужен облачный сервис (Julius, Hex, десктопные продукты), российские Visa и Mastercard не пройдут — процессинг отключён. Рабочие схемы — зарубежные карты, виртуальные карты с иностранным BIN, посредники; все они добавляют комиссию и риск для аккаунта.

Персональные данные. Аналитика часто касается клиентов, то есть персональных данных. У 152-ФЗ есть требования к обработке и хранению ПДн на территории РФ; это важно, когда вы отправляете выгрузки в зарубежную модель. Юридических выводов не делаю — это тема для юриста. Практическое правило: персональные данные в облако не отправлять.

Русскоязычный опыт. Материалов ровно по формуле «LLM + pandas + графики» в рунете мало, но есть практические кейсы:

Русскоязычный кейс: BI-дашборды через MCP и PostgreSQL
Скриншот статьи-кейса на Habr о сборке BI-дашбордов с LLM и MCP. Снято 10.09.2026.

Честные ограничения

  • Byaan — продукт автора, а не независимый бенчмарк. Джавед описывает свой опыт и свой инструмент; цифр вроде «сэкономили X часов» он не приводит, только качественную картину (customer success перестали дёргать инженеров). Это мнение практика, а не измеренный результат.
  • Я не запускал Byaan. Описание того, как он устроен (read-only wrapper, память, MCP-сервер), взято из поста и README репозитория; проверки на своей базе не было.
  • Агент ошибается в логике. Это не редкий сбой, а системная особенность: синтаксис pandas почти всегда верный, а определение метрики агент угадывает.
  • Бизнес-семантика не выводится из схемы. Что такое «активный клиент», «выручка без НДС», какие статусы исключать — этого нет в information_schema. Агенту это нужно явно положить.
  • График и вывод — разные вещи. Визуализация может быть идеальной, а интерпретация ложной. Проверять нужно интерпретацию, а не картинку.
  • Локальные модели слабее на сложном. Для разведки CSV и простых графиков их хватает, но на многошаговых расчётах с бизнес-логикой они ошибаются чаще облачных. Компромисс между приватностью и качеством.

Вывод

ИИ для аналитики данных — это не «подключить нейросеть к базе и она всё посчитает». Как показал кейс Byaan, узкое место — обвязка: определения метрик, память о прошлых ошибках и слой ограничений, который не даёт агенту испортить данные.

Практический порядок: опишите метрики и бизнес-правила текстом в репозитории, заведите скрипты с фиксированными определениями, и только затем просите агента считать и рисовать. Каждый вывод проверяйте вторым способом, а удачный расчёт сохраняйте скриптом, а не ответом в чате. Тогда аналитика с агентом становится воспроизводимой.

Связанные статьи

Читайте также: ИИ-агенты: примеры того, что агент реально делает в 2026 · Локальный или облачный кодинг-агент: где запускать в 2026

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector