Генеративный ИИ: RAG на примере 15 000 новостей Next и Mistral 7B
Мой Mac «рагует»!
Мы проанализировали контент более 15 000 новостных статей, опубликованных на Next за последние десять лет, используя технологию RAG (Retrieval-Augmented Generation). Цель состояла в том, чтобы предоставить эти данные генеративному ИИ для адаптации его ответов. Весь процесс был выполнен локально, на MacBook Pro с использованием Ollama и Mistral 7B.
Retrieval-Augmented Generation (RAG), или «генерация, дополненная извлечением» на русском языке, — это методика, позволяющая генеративным моделям ИИ использовать внешнюю базу знаний для формирования ответов на запросы. Для обозначения этой технологии часто используется акроним RAG.
RAG на моей машине
После краткого обзора технических аспектов и принципов работы RAG мы перейдем к практическому примеру. Мы собрали контент из более чем 15 000 статей Next за десять лет и интегрировали его с Mistral 7B — свободной большой языковой моделью (LLM) с 7,3 миллиардами параметров (выпущенной в 2023 году, что значительно меньше современных лидеров, обладающих сотнями или даже тысячами миллиардов параметров), распространяемой по лицензии Apache 2.0. Технология RAG не зависит от конкретной модели генеративного ИИ, и мы, конечно, могли бы использовать и другую.
- Итак, Next, что такое «RAG» в генеративном ИИ?
В нашем случае крайне важна была локальная обработка. Мы использовали MacBook Pro с чипом M2 и 16 ГБ объединенной памяти. Mistral 7B работает на нем без проблем, оставляя достаточно ресурсов для параллельного запуска других приложений. Что касается программного обеспечения, мы установили Ollama (с открытым исходным кодом, лицензия MIT). Мы уже рассказывали о ней в предыдущем руководстве о влиянии GPU на производительность генеративных ИИ.
Если технические детали вам не интересны, можете сразу перейти к разделу «Практические результаты использования RAG». Там вы найдете примеры ответов Mistral 7B на запросы с использованием RAG и без него (в обоих случаях локально).
- [Руководство] Использование генеративных ИИ локально и влияние GPU на производительность
Технические детали: Ollama, Mistral и Nomic
Кратко (но достаточно подробно) рассмотрим технические детали. Основные шаги таковы: сначала мы загружаем генеративную модель ИИ с помощью команды ollama pull mistral, затем другую модель для преобразования текста наших новостей в векторы (числовые представления, которые используются алгоритмами генеративного ИИ) с помощью ollama pull nomic-embed-text. Этот процесс также известен как эмбеддинг.
Небольшой скрипт автоматически делит текст на фрагменты (chunks), которые затем преобразуются в токены с помощью `nomic-embed-text`. Эта индексация выполняется только один раз. В нашем случае она заняла около трех часов (на MacBook Pro M2 с более чем 15 000 статей). При добавлении новых статей в будущем повторная индексация всего объема не требуется; достаточно обработать только новые тексты.
- ИИ: что такое нейрон (компьютерный), как он работает
Теперь перейдем к самому процессу запроса. Сначала запрос векторизуется, затем сравнивается со всеми векторами фрагментов статей из нашей базы. Мы выбираем 10 наиболее релевантных фрагментов, которые затем отправляются в Mistral вместе с исходным запросом. Таким образом, Mistral формирует свой ответ, опираясь как на свои внутренние знания, так и на эти 10 фрагментов новостей Next.
Можно уточнить запрос, чтобы ИИ использовал только данные из Next, например. Однако стоит помнить, что это статистическая модель (как и все генеративные ИИ), поэтому статистически она иногда может давать бессмысленные ответы; ничего нового под Солнцем.
Практические результаты использования RAG
Для наших тестов мы использовали Ollama на MacBook Pro, полностью в автономном режиме, так как все операции выполнялись локально.

Ниже представлены несколько запросов и ответы Mistral, как с использованием RAG, так и без него. Важное замечание: мы не ставили целью максимальную оптимизацию ответов (запрос, переданный Mistral вместе с наиболее релевантным контентом новостей, мог бы быть улучшен).
Мы предлагаем восемь запросов, охватывающих темы программного обеспечения, права, социальных сетей, аппаратного обеспечения, квантовых вычислений и т.д. Напоминаем, что ответы носят статистический характер и, по определению, могут значительно различаться при повторении одного и того же запроса несколько раз. Здесь мы приводим первый ответ, предложенный генеративным ИИ.
- T@LC: мы задали ИИ один и тот же вопрос 20 раз и получили 5 разных ответов
Если у вас есть идеи для запросов, которые можно было бы протестировать, не стесняйтесь предлагать их в комментариях; в зависимости от ситуации я смогу запустить их и опубликовать результаты в следующей статье.
Перейдем к серьезной части с первым вопросом, заданным Винсентом (он, я уверен, знает ответ)! Но ему любопытно увидеть результат с использованием контента новостей Next и без него... ведь большинство из них он сам и написал.
Можете ли вы предоставить краткий обзор недостатков Windows 11?
Ответ Mistral с RAG на основе новостей Next:
Свежие материалы — Новости технологий

HexaForce от Thales: новый ИИ-конкурент Maven, разработанный параллельно с Arcadia
Thales представила HexaForce – систему командования и контроля с использованием ИИ для вооруженных сил. Компания заявляет, что разработка идет параллельно с суверенным проектом Arcadia. HexaForce и Arcadia конкурируют с американской Palantir Maven и, судя по всему, черпают идеи из Artemis.

Обновлено: Google избежал разделения в онлайн-рекламе
Обновление от 17 сентября – Судебное решение о корректирующих мерах опубликовано, спустя 15 дней после вердикта, который отверг требование о разделении рекламной деятельности Google. Как и ожидалось, речь идёт в основном о технических мерах для открытия платформы конкуренции. Среди них:

Apple Watch Series 12 и AirPods 5: Новые Умные Часы и Наушники от Apple
Хотя главной звездой сентябрьской презентации Apple, безусловно, стал iPhone Duo, компания также представила новые умные часы и беспроводные наушники. Производитель не стал особо напрягаться, и количество новинок оказалось довольно скромным. Apple Watch Series 12 и Ultra 4 получили новый

Google инвестирует 13 миллиардов евро в Финляндию
Google обязалась инвестировать 13 миллиардов евро в Финляндию в течение следующих двух лет. Эти средства будут направлены на финансирование инфраструктурных проектов в южных и центральных регионах страны. В пресс-релизе, опубликованном в среду, 9 сентября, Google уточнила, что эта сумма в

Более 400 миллионов доменных имен в мире, .com безоговорочно доминирует
Интернет преодолел важный рубеж: количество доменных имен превысило 400 миллионов. Рынок доменов абсолютно доминируется расширением .com, которым управляет американская компания Verisign, и на него приходится более 166 миллионов доменных имен. В интернете доменные имена

ANSSI представляет REACTIV: Новый механизм для защиты госслужб от кибератак
7 сентября Национальное агентство по безопасности информационных систем (ANSSI) Франции объявило о запуске нового механизма под названием REACTIV (Межведомственное реагирование и действия в ответ на нарушения данных). Созданный по запросу премьер-министра, этот механизм призван обеспечить неме