27 июля 2026 г.
Новости технологий

Генеративный ИИ: RAG на примере 15 000 новостей Next и Mistral 7B

30 июня 2026 г.Павел Игнатьев4 мин

Мой Mac «рагует»!

Генеративный ИИ: RAG на примере 15 000 новостей Next и Mistral 7B

Мы проанализировали контент более 15 000 новостных статей, опубликованных на Next за последние десять лет, используя технологию RAG (Retrieval-Augmented Generation). Цель состояла в том, чтобы предоставить эти данные генеративному ИИ для адаптации его ответов. Весь процесс был выполнен локально, на MacBook Pro с использованием Ollama и Mistral 7B.

Retrieval-Augmented Generation (RAG), или «генерация, дополненная извлечением» на русском языке, — это методика, позволяющая генеративным моделям ИИ использовать внешнюю базу знаний для формирования ответов на запросы. Для обозначения этой технологии часто используется акроним RAG.

RAG на моей машине

После краткого обзора технических аспектов и принципов работы RAG мы перейдем к практическому примеру. Мы собрали контент из более чем 15 000 статей Next за десять лет и интегрировали его с Mistral 7B — свободной большой языковой моделью (LLM) с 7,3 миллиардами параметров (выпущенной в 2023 году, что значительно меньше современных лидеров, обладающих сотнями или даже тысячами миллиардов параметров), распространяемой по лицензии Apache 2.0. Технология RAG не зависит от конкретной модели генеративного ИИ, и мы, конечно, могли бы использовать и другую.

  • Итак, Next, что такое «RAG» в генеративном ИИ?

В нашем случае крайне важна была локальная обработка. Мы использовали MacBook Pro с чипом M2 и 16 ГБ объединенной памяти. Mistral 7B работает на нем без проблем, оставляя достаточно ресурсов для параллельного запуска других приложений. Что касается программного обеспечения, мы установили Ollama (с открытым исходным кодом, лицензия MIT). Мы уже рассказывали о ней в предыдущем руководстве о влиянии GPU на производительность генеративных ИИ.

Если технические детали вам не интересны, можете сразу перейти к разделу «Практические результаты использования RAG». Там вы найдете примеры ответов Mistral 7B на запросы с использованием RAG и без него (в обоих случаях локально).

  • [Руководство] Использование генеративных ИИ локально и влияние GPU на производительность

Технические детали: Ollama, Mistral и Nomic

Кратко (но достаточно подробно) рассмотрим технические детали. Основные шаги таковы: сначала мы загружаем генеративную модель ИИ с помощью команды ollama pull mistral, затем другую модель для преобразования текста наших новостей в векторы (числовые представления, которые используются алгоритмами генеративного ИИ) с помощью ollama pull nomic-embed-text. Этот процесс также известен как эмбеддинг.

Небольшой скрипт автоматически делит текст на фрагменты (chunks), которые затем преобразуются в токены с помощью `nomic-embed-text`. Эта индексация выполняется только один раз. В нашем случае она заняла около трех часов (на MacBook Pro M2 с более чем 15 000 статей). При добавлении новых статей в будущем повторная индексация всего объема не требуется; достаточно обработать только новые тексты.

  • ИИ: что такое нейрон (компьютерный), как он работает

Теперь перейдем к самому процессу запроса. Сначала запрос векторизуется, затем сравнивается со всеми векторами фрагментов статей из нашей базы. Мы выбираем 10 наиболее релевантных фрагментов, которые затем отправляются в Mistral вместе с исходным запросом. Таким образом, Mistral формирует свой ответ, опираясь как на свои внутренние знания, так и на эти 10 фрагментов новостей Next.

Можно уточнить запрос, чтобы ИИ использовал только данные из Next, например. Однако стоит помнить, что это статистическая модель (как и все генеративные ИИ), поэтому статистически она иногда может давать бессмысленные ответы; ничего нового под Солнцем.

Практические результаты использования RAG

Для наших тестов мы использовали Ollama на MacBook Pro, полностью в автономном режиме, так как все операции выполнялись локально.

Ниже представлены несколько запросов и ответы Mistral, как с использованием RAG, так и без него. Важное замечание: мы не ставили целью максимальную оптимизацию ответов (запрос, переданный Mistral вместе с наиболее релевантным контентом новостей, мог бы быть улучшен).

Мы предлагаем восемь запросов, охватывающих темы программного обеспечения, права, социальных сетей, аппаратного обеспечения, квантовых вычислений и т.д. Напоминаем, что ответы носят статистический характер и, по определению, могут значительно различаться при повторении одного и того же запроса несколько раз. Здесь мы приводим первый ответ, предложенный генеративным ИИ.

  • T@LC: мы задали ИИ один и тот же вопрос 20 раз и получили 5 разных ответов

Если у вас есть идеи для запросов, которые можно было бы протестировать, не стесняйтесь предлагать их в комментариях; в зависимости от ситуации я смогу запустить их и опубликовать результаты в следующей статье.

Перейдем к серьезной части с первым вопросом, заданным Винсентом (он, я уверен, знает ответ)! Но ему любопытно увидеть результат с использованием контента новостей Next и без него... ведь большинство из них он сам и написал.

Можете ли вы предоставить краткий обзор недостатков Windows 11?

Ответ Mistral с RAG на основе новостей Next: