Лекция 3.4 · Модуль 3 · Финал

Дата-анализ с нейросетями:
классификация, сущности, суммаризация, прогноз

Как превратить неструктурированные тексты, документы и таблицы в структуру, выводы и сценарии — и где проходит граница между помощью нейросети и решением человека.

⏱ ~50 минут 🧠 4 задачи анализа 🔗 Полный пайплайн 🇷🇺 Сервисы доступны в РФ
01
Подход

Место нейросети в анализе данных

Классическая аналитика хорошо работает со структурированными данными: таблицами, числами, временными рядами. Но большая часть данных организации — неструктурированные: тексты отзывов, документы, письма, посты, расшифровки звонков. Нейросети — это инструмент, который превращает неструктурированное в структурированное, открывая эти данные для анализа.

🧠

Дата-анализ с нейросетями

Применение языковых и мультимодальных моделей к четырем базовым задачам работы с данными: классификации (разнести по категориям), извлечению сущностей (вытащить имена, даты, суммы), суммаризации (сжать до выводов) и прогнозированию (построить сценарии). Нейросеть не заменяет аналитика — она закрывает трудоёмкие шаги обработки, оставляя человеку интерпретацию и проверку.

🔗

Мультимодальная нейросеть

Мультимодальная нейросеть сочетает работу с текстом, таблицами, изображениями, ссылками и документами. В аналитике она помогает быстрее перейти от «много материалов» к проверяемой структуре исследования. Именно мультимодальность позволяет загрузить в Qwen таблицу, график и пояснительную записку — и получить единый разбор.

Рабочая цепочка анализа с нейросетью выглядит так: данные → модель → интерпретация → проверка → решение. Модель стоит в середине, а не в конце: всё, что она выдаёт, проходит через интерпретацию и проверку человека. Это отличает профессиональный дата-анализ от «спросил у нейросети и поверил».

01 Задача · Classification

Классификация

Разнесение объектов (текстов, строк, изображений) по заранее заданным классам: отзывы — по темам, обращения — по типам, документы — по видам. Превращает «тысячу текстов» в распределение по категориям, с которым уже можно работать: строить диаграммы, сегментировать, приоритезировать.

GigaChatQwenтематическая разметка
02 Задача · NER

Извлечение сущностей

Named Entity Recognition — извлечение из текста именованных сущностей: имён, организаций, локаций, дат, сумм. Превращает свободный текст в структурированные поля для таблиц и дашбордов.

QwenGigaChatJSON
03 Задача · Summarization

Суммаризация

Сжатие больших объёмов текста до тезисов, выводов и черновика отчёта. Многоступенчатая суммаризация: документ → тезисы → выводы → отчёт — с сохранением проверяемых ссылок на источник.

GigaChatPerplexityDeep Research
04 Задача · Prediction

Прогнозирование

Экстраполяция трендов и построение сценариев «что будет, если…». Нейросеть здесь — генератор гипотез и допущений, который дополняет статистические модели, но не заменяет их: прогноз — это гипотеза, требующая проверки на новых данных.

GigaChatQwenсценарии
ℹ️

Правило курса, сформулированное в лекции 3.1, остаётся в силе: нейросеть ускоряет поиск и интерпретацию, но не отменяет проверку источников, ограничений выборки и здравый смысл. В дата-анализе это правило — не рекомендация, а обязательное требование.

02
Задача 1

Классификация текстов и данных

Классификация — самая частая задача дата-анализа с нейросетями: у вас есть много текстов, и нужно разложить их по категориям, чтобы увидеть структуру.

🗂

Классификация

Автоматическое присвоение объектам заранее определённых классов. В работе с текстами: отзыв → «доставка / качество / цена / сервис», обращение в поддержку → «жалоба / вопрос / благодарность», документ → «договор / счёт / акт». Результат — таблица «объект → класс», по которой строятся распределения, сегменты и приоритеты.

🤖
РФ · ИИ-аналитика · Сбер

GigaChat: Big Data и Deep Research

Нейросервис для исследования темы, работы с документами, суммаризации и подготовки первичных аналитических выводов. Big Data API предназначен для задач работы с массивами текстов.

Для задач: суммаризация, классификация текстов, исследовательские обзоры.
Мини-практика: дать 10 отзывов, попросить выделить темы и вручную проверить три результата.
📄
текст · файлы · изображения

Qwen

Мультимодальная модель для работы с русским текстом, документами, таблицами и изображениями; удобна для классификации, извлечения сущностей и подготовки черновика отчёта.

Полезно: тематическая разметка отзывов, сводка таблицы, интерпретация графика.
Проверка: просить таблицу «вывод — доказательство — ссылка/строка данных».
PROMPTGigaChat / Qwen · классификация отзывов
Перед тобой 20 отзывов о сервисе доставки. Классифицируй каждый в один из классов: доставка | качество | цена | сервис | другое. Если отзыв касается двух тем — укажи основную и вторичную. Ответ — таблица: № отзыва | основной класс | вторичный | ключевая фраза.
Почему так сформулировано

Закрытый список классов не даёт модели «придумывать» категории, требование ключевой фразы делает разметку проверяемой, а учёт двух тем отражает реальность (отзыв часто про «и доставку, и цену»). После разметки аналитик вручную проверяет несколько случайных строк и оценивает согласованность с ручной разметкой.

Мини-практика (из материалов курса): дайте нейросети 10 отзывов, попросите выделить темы и вручную проверьте три результата. Если совпадение 3 из 3 — разметке можно доверять; если нет — уточните промпт и повторите.

03
Задача 2

Извлечение сущностей (NER)

Если классификация отвечает на вопрос «к какой категории это относится», то NERNamed Entity Recognition — распознавание именованных сущностей: задача автоматического извлечения из текста имён, организаций, локаций, дат, сумм и других значимых объектов с указанием их типа. отвечает на вопрос «какие конкретные факты здесь есть». Это превращение свободного текста в поля таблицы.

🏷

Извлечение сущностей (NER)

Извлечение из неструктурированного текста именованных сущностей — имён людей, названий организаций, локаций, дат, денежных сумм, категорий. Результат — структурированные поля, которые можно загрузить в таблицу, связать с другими данными и визуализировать. Например, из тысячи новостей извлекаются все упомянутые компании и суммы сделок — получается готовый датасет для анализа рынка.

Тип сущностиЧто извлекаетсяПример
PERSONИмена и фамилии людей«Иван Петров»
ORGОрганизации, компании, учреждения«ООО „Вектор“», «МГУ»
LOCГеографические объекты«Москва», «Казань»
DATEДаты и периоды«15 января 2026», «Q3»
MONEYДенежные суммы«12 500 ₽», «1,2 млн»
CATEGORYТемы, классы, рубрики«доставка», «гарантия»
PROMPTQwen · извлечение сущностей в JSON
Извлеки из текста новости все сущности. Ответ — строго JSON: {"persons": [...], "orgs": [...], "locations": [...], "dates": [...], "money": [...]} Правила: — даты приводи к формату ГГГГ-ММ-ДД; — суммы — числом в рублях; — если сущностей типа нет — пустой массив; — без комментариев, только JSON.
Что это даёт аналитику

Жёсткий JSON-формат с нормализацией (даты — к стандарту, суммы — к числу) делает вывод машиночитаемым: его можно сразу скормить в DataLens или OpenRefine. Пустые массивы вместо догадок защищают от галлюцинаций — модель не будет выдумывать несуществующие сущности.

🧪

Проверьте понимание · Вопрос 1

Что делает задача NER (извлечение сущностей)?

04
Задача 3

Суммаризация и подготовка отчётов

Суммаризация — сжатие большого объёма текста до сути. Но в аналитике важна не «краткость», а многоступенчатость: документ → тезисы → выводы → отчёт. На каждом шаге теряется объём, но растёт плотность смысла — и сохраняется проверяемость.

СТУПЕНЬ 1документ / массив текстов
СТУПЕНЬ 2тезисы
СТУПЕНЬ 3выводы
СТУПЕНЬ 4отчёт для команды
🌐
поиск с источниками

Perplexity — обзор источников

Поисковый ИИ для исследования тем, сопоставления источников, подготовки обзора и формулирования уточняющих вопросов.

Полезно: быстрый обзор рынка, поиск источников, сравнительная таблица.
Проверка: открывать ключевые ссылки и отделять факт из источника от интерпретации модели.
📝
черновик отчёта

Qwen — от тезисов к отчёту

Мультимодальная модель для работы с русским текстом, документами, таблицами и изображениями; удобна для классификации, извлечения сущностей и подготовки черновика отчёта.

Полезно: тематическая разметка отзывов, сводка таблицы, интерпретация графика.
Проверка: просить таблицу «вывод — доказательство — ссылка/строка данных».
PROMPTGigaChat · многоступенчатая суммаризация
Прочитай приложенный отчёт (40 страниц). Шаг 1. Выдели 10 ключевых тезисов. Шаг 2. Сгруппируй их в 3 вывода. Шаг 3. Для каждого вывода укажи страницу-источник. Шаг 4. Сформулируй 2 рекомендации. Формат: вывод — тезисы — страница — рекомендация.
Где здесь человек

Нейросеть строит каркас отчёта, но указание страниц-источников — ключевое требование: каждый вывод должен быть проверяем по первоисточнику. Аналитик открывает указанные страницы, сверяет формулировки и только после этого подписывает отчёт. Вывод без ссылки на источник — не вывод, а гипотеза.

Доступность Perplexity из РФ. Сервис официально ограничивает доступ из России — нужен VPN, оплата подписки российскими картами недоступна. Для разовых обзоров хватает бесплатного лимита. Стабильная российская альтернатива для research — GigaChat Deep Research, для работы с документами — Qwen.

05
Задача 4

Прогнозирование и сценарный анализ

Прогнозирование — самая «осторожная» задача дата-анализа. Нейросеть здесь не вычисляет будущее, а помогает сформулировать сценарии: что произойдёт при разных допущениях, какие риски учесть, какие тренды экстраполировать.

🔮

Прогнозирование с нейросетями

Построение сценариев «что будет, если…» на основе имеющихся данных и допущений. Нейросеть дополняет статистические модели: помогает сформулировать допущения, описать риски, подготовить несколько вариантов развития событий. Важно: прогноз — это не факт, а гипотеза, требующая проверки на новых данных.

ПараметрСтатистическая модельНейросеть
Входные данныеСтруктурированные временные рядыТекст + таблицы + контекст
РезультатЧисленный прогноз с доверительным интерваломГипотезы, сценарии, описание рисков
ПроверкаМетрики точности (MAPE и др.)Верификация на новых данных, экспертная оценка
Роль в анализеБазовый прогнозДополнение: допущения, риски, альтернативные сценарии
PROMPTQwen / GigaChat · сценарный анализ
Вот данные о продажах за 12 месяцев (таблица). Построй три сценария на следующий квартал: — базовый (тренд продолжается) — оптимистичный (+15% к тренду) — пессимистичный (−20% к тренду) Для каждого: прогноз по месяцам, ключевые допущения, главный риск и сигнал, что сценарий сбывается.
Почему сценарии, а не «точный прогноз»

Требование трёх сценариев с допущениями и рисками переводит разговор из «нейросеть сказала, что будет» в «вот варианты и условия их реализации». Это честный формат прогноза: решение принимается не по одной цифре, а по пониманию диапазона возможностей. Для численных прогнозов используйте статистические методы (Python + pandas/sklearn), а нейросеть — для сценарной обвязки.

🧪

Проверьте понимание · Вопрос 2

Как правильно относиться к прогнозу, построенному нейросетью?

06
Практика

Полный пайплайн: от сырых текстов к решению

Четыре задачи складываются в один конвейер. Ниже — сквозной пример: сырые отзывы превращаются в дашборд и управленческий отчёт с помощью бесплатных российских сервисов.

ШАГ 1сырые данные
ШАГ 2очистка
ШАГ 3классификация
ШАГ 4NER
ШАГ 5суммаризация
ШАГ 6визуализация
ШАГ 7отчёт и решение
data_pipeline.log
# Полный цикл дата-анализа с нейросетями
[1] сырые данные   reviews.csv · 1 240 строк · текстовое поле
[2] очистка        OpenRefine → −38 дублей, нормализация кодировки
[3] классификация  GigaChat → темы: доставка / качество / цена / сервис
[4] NER            Qwen → JSON: города, суммы, даты обращений
[5] суммаризация   GigaChat → 10 тезисов → 3 вывода → 2 рекомендации
[6] визуализация   DataLens → дашборд: темы × периоды × города
[7] отчёт          выводы + доказательства + ссылки на строки данных
────────────────────────────────────────────────────
результат: от сырого текста — к проверяемому управленческому решению

Каждый шаг готовит данные для следующего, и перестановка ломает конвейер:

  • Очистка до классификации — иначе дубли и мусор исказят распределение тем.
  • Классификация до NER — сначала структура «о чём текст», потом «какие факты внутри».
  • NER до суммаризации — извлечённые сущности дают суммаризации конкретные опоры (города, суммы, даты), а не общие слова.
  • Суммаризация до визуализации — дашборд строится по уже размеченным данным, а отчёт опирается на выводы с доказательствами.

Нейросети закрывают шаги 3–5, но человек присутствует на каждом этапе:

  • Шаг 1–2: аналитик определяет, какие данные релевантны, и задаёт правила очистки.
  • Шаг 3–4: аналитик задаёт список классов и типы сущностей, проверяет случайные строки разметки.
  • Шаг 5: аналитик сверяет выводы с источниками (страница/строка данных).
  • Шаг 6–7: аналитик интерпретирует дашборд и принимает решение — нейросеть решения не принимает.
07
Ограничения

Ограничения и этика дата-анализа с нейросетями

Чем активнее нейросеть участвует в анализе, тем важнее понимать её ограничения. Четыре главных риска, о которых аналитик обязан помнить.

👻

Галлюцинации

Модель может уверенно выдать выдуманный факт, несуществующую ссылку или число, которого нет в данных. Защита: требовать «вывод — доказательство — строка данных» и сверять с первоисточником.

⚖️

Смещение выборки

Если обучающие или входные данные смещены, модель унаследует и усилит это смещение. Анализ «только по отзывам из одного канала» даст картину, неверную для всей аудитории. Защита: проверять репрезентативность выборки.

🔁

Воспроизводимость

Один и тот же промпт может дать разные ответы в разных запусках. Если результат нельзя воспроизвести, это не анализ, а мнение. Защита: фиксировать промпты, версию модели и параметры, сохранять промежуточные результаты.

🔒

Конфиденциальность

Публичные нейросервисы не предназначены для персональных данных и коммерческой тайны. Защита: обезличивать данные перед загрузкой, использовать корпоративные API с гарантиями, соблюдать 152-ФЗ.

Главное правило: нейросеть — помощник аналитика, а не замена проверки. Проверяйте источники, соблюдайте правовые и этические ограничения, фиксируйте метод работы, чтобы результат мог воспроизвести другой человек.

🧪

Проверьте понимание · Вопрос 3

Что НЕ следует загружать в публичный нейросервис для анализа?

08
Лайфхаки и абьюз сервисов

Дата-анализ без бюджета

ЛАЙФХАК 01

Qwen — бесплатно и с запасом

Qwen работает бесплатно с большими лимитами: классификация, извлечение сущностей, суммаризация и интерпретация графиков не требуют подписки. Для учебных и большинства рабочих задач этого достаточно — платные модели нужны только для очень больших объёмов.

ЛАЙФХАК 02

GigaChat API — free-лимиты для пакетной обработки

У GigaChat API есть бесплатные лимиты, которых хватает для пакетной классификации и разметки сотен текстов. Это превращает разовый «спросить нейросеть» в воспроизводимый конвейер обработки данных.

АБЬЮЗ 03

Таблица → Qwen → DataLens: бесплатный пайплайн

Загрузите таблицу в Qwen, попросите JSON-разметку (классы + сущности), сохраните результат и скормите в DataLens. Получается бесплатный конвейер «сырьё → структура → визуализация» без единой платной подписки.

ЛАЙФХАК 04

Hugging Face — модели и датасеты

На Hugging Face — крупнейшей открытой платформе — доступны тысячи моделей и датасетов, включая русскоязычные. Полезно для знакомства с готовыми NER- и классификационными моделями (доступ отдельных разделов из РФ может требовать проверки).

09
Сводка

Карта задач и ключевые выводы

ЗадачаИнструментыРезультат
КлассификацияGigaChat, QwenТаблица «объект → класс», распределения
Извлечение сущностей (NER)Qwen, GigaChatJSON-поля: имена, организации, даты, суммы
СуммаризацияGigaChat Deep Research, Perplexity, QwenТезисы → выводы → черновик отчёта
ПрогнозированиеGigaChat, Qwen + статистикаСценарии с допущениями и рисками
Полный пайплайнOpenRefine → GigaChat/Qwen → DataLensОт сырых текстов к дашборду и решению
0

задачи дата-анализа с нейросетями

0

шагов сквозного пайплайна

0

ограничения, о которых нужно помнить

0
%

выводов требуют проверки человеком

Ключевые выводы

Нейросети открывают для анализа главный неструктурированный массив данных организации — тексты. Четыре базовые задачи (классификация, извлечение сущностей, суммаризация, прогнозирование) складываются в сквозной пайплайн: сырые данные → очистка → разметка → выводы → визуализация → решение. GigaChat и Qwen закрывают разметку и суммаризацию, Perplexity — обзор источников, DataLens — визуализацию; все базовые шаги доступны бесплатно и из РФ.

При этом нейросеть стоит в середине цепочки «данные → модель → интерпретация → проверка → решение», а не в конце. Галлюцинации, смещение выборки, невоспроизводимость и конфиденциальность — четыре ограничения, которые делают проверку человеком обязательной. Финальное правило курса: нейросеть — помощник аналитика; проверяйте источники, фиксируйте метод и не доверяйте выводу без доказательства.