RAG - jak AI korzysta z Twoich dokumentów

Zagadka: skąd chatbot zna Twój raport?
Dział zatytułowany „Zagadka: skąd chatbot zna Twój raport?”Z rozdziału o modelach językowych wiesz, że model zna tylko to, co widział w treningu - a trening skończył się w konkretnym dniu. Twojego wewnętrznego raportu, umowy z klientem ani notatek ze spotkania na pewno w nim nie było.
A jednak: wrzucasz PDF do chatbota i po chwili dostajesz trafne odpowiedzi na pytania o jego treść, często z odsyłaczem do konkretnej strony. Magia? Nie - RAG. I warto zrozumieć, jak działa, bo to obecnie najczęstszy sposób, w jaki AI trafia do firm i narzędzi, z których korzystasz.
Egzamin z otwartą książką
Dział zatytułowany „Egzamin z otwartą książką”RAG (Retrieval Augmented Generation, czyli generowanie wspomagane wyszukiwaniem) to pomysł opisany po raz pierwszy przez badaczy Meta w 2020 roku (Lewis i in.): zamiast liczyć na to, że model “pamięta” właściwą informację, podsuńmy mu ją w momencie pytania.
Jak to działa krok po kroku
Dział zatytułowany „Jak to działa krok po kroku”Cały proces składa się z trzech etapów - dwa pierwsze dzieją się poza Twoim wzrokiem:
1. INDEKSOWANIE (raz, przy dodaniu dokumentów): Twoje pliki → podział na fragmenty → zapis w bazie w postaci umożliwiającej wyszukiwanie po znaczeniu
2. WYSZUKIWANIE (przy każdym pytaniu): Twoje pytanie → znajdź fragmenty, które najlepiej pasują znaczeniowo do pytania
3. GENEROWANIE: Znalezione fragmenty + Twoje pytanie → model pisze odpowiedź na podstawie podsuniętych fragmentówKluczowy jest krok drugi: system nie szuka po słowach kluczowych jak stary Google, tylko po znaczeniu. Pytanie “ile mamy urlopu?” znajdzie fragment regulaminu o “wymiarze corocznego płatnego wypoczynku”, mimo że żadne słowo się nie pokrywa. Umożliwiają to embeddingi - numeryczne reprezentacje znaczenia tekstu, które poznałeś w poprzednim rozdziale.
Gdzie używasz RAG, nie wiedząc o tym
Dział zatytułowany „Gdzie używasz RAG, nie wiedząc o tym”- Wgrywanie plików do chatbota - załączasz PDF czy arkusz, a model odpowiada na jego podstawie
- NotebookLM - narzędzie Google zbudowane w całości wokół tej idei: wgrywasz źródła, a notatnik odpowiada wyłącznie na ich podstawie i podaje cytaty (notebooklm.google)
- Projekty w ChatGPT i Claude - dokumenty projektu stają się stałą bazą wiedzy, do której model sięga w każdej rozmowie
- Chatbot z wyszukiwaniem internetu - to też RAG, tylko zamiast Twoich plików przeszukiwany jest internet; więcej w rozdziale o trybach pracy chatbotów
- Firmowe chatboty - asystent odpowiadający na pytania klientów na podstawie bazy pomocy technicznej to dziś klasyczne wdrożenie RAG
Co RAG zmienia, a czego nie
Dział zatytułowany „Co RAG zmienia, a czego nie”Zmienia dużo:
- Mniej halucynacji - model opiera się na podsuniętych faktach, nie na “przeświadczeniu”; szczególnie przy pytaniach o konkrety, których nie było w treningu
- Aktualność - wystarczy zaktualizować dokumenty w bazie; nie trzeba trenować modelu od nowa
- Źródła - dobre narzędzia RAG wskazują fragment, z którego wzięły odpowiedź, więc możesz je sprawdzić jednym kliknięciem
- Prywatna wiedza - model odpowiada o rzeczach, których publicznie nie ma: Twoje notatki, procedury firmy, dokumentacja produktu
Nie zmienia wszystkiego:
- Jeśli wyszukiwanie znajdzie złe fragmenty, model wygeneruje pewnie brzmiącą odpowiedź na złej podstawie
- Model może źle zinterpretować poprawnie znaleziony fragment - zwłaszcza tabele i dane liczbowe
- Śmieci na wejściu to śmieci na wyjściu: RAG na chaotycznej, nieaktualnej bazie dokumentów daje chaotyczne, nieaktualne odpowiedzi
RAG czy duże okno kontekstowe?
Dział zatytułowany „RAG czy duże okno kontekstowe?”Skoro modele mają dziś ogromne okna kontekstowe, to po co wyszukiwanie - nie można po prostu wkleić wszystkiego?
Można, jeśli “wszystko” to jeden dokument. Przy pojedynczym raporcie wklejenie całości do rozmowy bywa najlepszym rozwiązaniem - model widzi pełny kontekst, nic mu nie umyka. Ale przy setkach dokumentów przestaje się to spinać z trzech powodów: całość nie mieści się w oknie, płacisz za każdy token przetworzonego tekstu, a modele gorzej radzą sobie z informacją zakopaną w środku bardzo długiego kontekstu (Liu i in., 2023).
Praktyczna reguła: jeden dokument - wklej; biblioteka dokumentów - RAG.
Źródła i dalsze lektury
Dział zatytułowany „Źródła i dalsze lektury”- Lewis i in., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks” (2020) - praca, która dała technice nazwę
- AWS, “What is RAG?” - przystępne wyjaśnienie z perspektywy wdrożeń
- NotebookLM - narzędzie Google zbudowane wokół pracy na własnych źródłach
- Liu i in., “Lost in the Middle” (2023) - dlaczego bardzo długi kontekst nie zastępuje wyszukiwania
Częste pytania
Czym jest RAG w prostych słowach?
RAG to technika, w której AI najpierw wyszukuje odpowiednie fragmenty w bazie dokumentów, a dopiero potem pisze odpowiedź na ich podstawie - zamiast odpowiadać wyłącznie z "pamięci" wyniesionej z treningu. To jak egzamin z otwartą książką zamiast odpowiadania z głowy.
Czy RAG eliminuje halucynacje AI?
Ogranicza je, ale nie eliminuje. Model dostaje prawdziwe fragmenty dokumentów, więc rzadziej zmyśla fakty - ale nadal może źle zinterpretować znaleziony fragment albo połączyć fragmenty w błędny wniosek. Odpowiedzi ze wskazanym źródłem zawsze da się sprawdzić i warto z tego korzystać.
Gdzie korzystam z RAG na co dzień?
Wgrywając pliki do chatbota, pracując w NotebookLM, używając projektów w ChatGPT lub Claude oraz zawsze, gdy chatbot przeszukuje internet przed odpowiedzią. Firmowe chatboty odpowiadające na podstawie wewnętrznej bazy wiedzy to również RAG.
made with ❤️ by aitomate.pl - Łukasz Podgórski