Czym jest RAG i kiedy się opłaca
RAG przed odpowiedzią pobiera trafne materiały i przekazuje je modelowi jako kontekst. Zobacz, kiedy pomaga, czym różni się od fine-tuningu i ile kosztuje.
RAG (Retrieval-Augmented Generation) to technika, w której system przed sformułowaniem odpowiedzi wyszukuje trafne materiały i przekazuje je modelowi jako kontekst. Dzięki temu odpowiedź może korzystać z aktualnych danych spoza parametrów modelu i wskazywać źródła. Nazwę oraz podstawowy mechanizm opisali Lewis i współautorzy w pierwotnej pracy o RAG z 2020 roku.
To jest cała idea. Reszta tego wpisu to konsekwencje, koszty i pułapki.
Jak RAG działa krok po kroku
Pięć etapów. Przygotowanie źródeł i indeksu powtarza się po zmianach materiału, a wyszukiwanie i generowanie — przy pytaniu:
- Zbieranie źródeł. Dokumenty, umowy, procedury, wątki mailowe, tabele. Jednorazowo, potem cyklicznie przy aktualizacjach.
- Podział i opis materiału. Dokument dzieli się według jego struktury, a fragmenty dostają metadane. Wpływ rozmiaru fragmentu trzeba sprawdzić w ewaluacji; nie istnieje jedna dobra długość dla wszystkich źródeł.
- Indeksowanie. W popularnym wariancie fragmenty dostają reprezentacje wektorowe; indeks może też obsługiwać wyszukiwanie słów, filtrów i metadanych. Dobór mechanizmu zależy od pytań.
- Wyszukiwanie przy pytaniu. System pobiera kandydatów metodą wektorową, tekstową, hybrydową albo zapytaniem do ustrukturyzowanego źródła i może ponownie ustawić ich kolejność.
- Generowanie i kontrola odpowiedzi. Model dostaje pytanie oraz znaleziony materiał. Produkcyjna implementacja powinna wskazywać źródła i mieć regułę odmowy lub eskalacji, gdy podstawa jest niewystarczająca.
Sama instrukcja nie gwarantuje posłuszeństwa modelu, dlatego potrzebne są cytaty możliwe do sprawdzenia, kryterium wystarczającej podstawy i poprawna odpowiedź „brak danych”. RAG może ograniczać konfabulacje, ale ich nie usuwa.
RAG czy fine-tuning? Tabela decyzyjna
RAG i fine-tuning mogą się uzupełniać, ale ich główne zastosowania są inne. RAG dostarcza materiał w czasie odpowiedzi, a strojenie zmienia zachowanie modelu na podstawie przykładów; samo strojenie nie jest niezawodnym magazynem aktualnej, cytowalnej wiedzy.
| RAG | Fine-tuning | |
|---|---|---|
| Odpowiada na pytanie | „co jest w naszych danych” | „w jakim stylu i formacie odpowiadać” |
| Aktualizacja wiedzy | odśwież indeks po zmianie źródła | zwykle wymaga nowego cyklu strojenia |
| Podanie źródła | można powiązać odpowiedź z pobranym fragmentem | nie wynika ze strojenia; wymaga osobnego mechanizmu |
| Koszt wejścia | zależy od źródeł, uprawnień i ewaluacji | zależy od danych treningowych i procesu strojenia |
| Zmiana modelu bazowego | wymaga ponownej ewaluacji wyszukiwania i odpowiedzi | może wymagać ponownego strojenia i ewaluacji |
Reguła praktyczna: aktualną, cytowalną wiedzę zwykle łatwiej dostarczać przez wyszukiwanie, a format i zachowanie kształtować instrukcją, przykładami lub strojeniem. Te techniki można łączyć; wybór potwierdza się testem na docelowych zadaniach.
Co decyduje o tym, czy RAG działa dobrze
Cztery obszary do wspólnego testowania; ich wpływ zależy od źródeł i rodzaju pytań:
- Stan źródeł. Sprzeczne wersje procedury mogą dostarczyć sprzeczne podstawy. Potrzebne są wersjonowanie, właściciel dokumentu i reguła pierwszeństwa źródeł.
- Sposób cięcia i wzbogacania fragmentów. Fragment bez kontekstu („punkt 4.2 nie dotyczy klientów z grupy B”) jest bezużyteczny albo szkodliwy. Fragmenty opatrujemy metadanymi: skąd pochodzą, z jakiej wersji, kogo dotyczą.
- Jakość wyszukiwania. Samo podobieństwo wektorowe może słabiej obsługiwać nazwy własne, numery i symbole. Wyszukiwanie hybrydowe oraz reranking są hipotezami do sprawdzenia na zestawie pytań, nie automatyczną receptą.
- Ewaluacja. Zestaw pytań z oczekiwanymi odpowiedziami, uruchamiany po każdej zmianie. Bez tego „poprawiliśmy” znaczy „zmieniliśmy i mamy nadzieję”.
Kiedy RAG się nie sprawdzi
- Gdy wiedzy nie da się wiarygodnie pozyskać. Tekst można indeksować bezpośrednio, a obrazy lub skany po ekstrakcji albo w potoku multimodalnym. Jeśli odpowiedź siedzi wyłącznie w głowie jednej osoby, najpierw trzeba ją udokumentować.
- Gdy pytania wymagają liczenia lub agregacji. „Ilu klientów odeszło w czerwcu” to zapytanie do bazy, nie do samego wyszukiwania semantycznego. Potrzebna jest warstwa analityczna albo kontrolowany mechanizm tworzenia i walidowania zapytań.
- Gdy pytania wymagają obliczeń lub przechodzenia po relacjach. „Które umowy z tym podwykonawcą kończą się przed audytem” lepiej obsłuży zapytanie do danych ustrukturyzowanych, czasem wspierane przez graf wiedzy, niż samo podobieństwo fragmentów.
- Gdy mały, stabilny zbiór mieści się bezpiecznie w kontekście. Podanie całości może być prostsze od pipeline’u, o ile koszt, uprawnienia i jakość odpowiedzi przejdą test.
Ile kosztuje wdrożenie RAG
Nasze widełki na sierpień 2026 r.: pilotaż na wycinku wiedzy 12 000–30 000 zł netto (orientacyjnie 3–5 tygodni, z ewaluacją), produkcyjny system z integracją 30 000–120 000 zł netto, utrzymanie jakości 2 000–6 000 zł netto/mc.
Do tego dochodzi bieżący koszt modeli i infrastruktury, zależny między innymi od wolumenu, długości kontekstu, pamięci podręcznej i ponowień. Pilotaż pozwala zmierzyć jakość, wykorzystanie przez użytkowników oraz koszt na własnych danych przed decyzją o produkcji.
Najczęstsze pytania
Czy nasze dokumenty trafią do trenowania modelu?
RAG sam tego nie rozstrzyga. Dokumenty mogą zostać w Twojej bazie, ale pobrane fragmenty nadal trafiają do wybranego modelu. Użycie do trenowania, retencja i miejsce przetwarzania zależą od usługi, planu i umowy. Te warunki trzeba sprawdzić przed wdrożeniem.
Czy RAG usuwa halucynacje?
Ogranicza je, nie usuwa. Model wciąż może źle zinterpretować fragment albo odpowiedzieć, gdy powinien powiedzieć „nie wiem”. Dlatego wymuszamy cytowanie źródła i mierzymy, jak często system odpowiada bez podstawy.
Ile źródeł trzeba mieć, żeby zaczęło to mieć sens?
Nie ma minimalnej liczby źródeł. Policz częstotliwość i koszt wyszukiwania, ryzyko błędnej odpowiedzi, jakość dokumentów oraz koszt budowy i utrzymania. Mały zbiór może uzasadniać prostsze wyszukiwanie lub podanie całego kontrolowanego kontekstu zamiast pełnego pipeline'u.
RAG i grafy wiedzy to technologie; dla Ciebie liczy się efekt, który nazywamy second brain dla firm. Własne narzędzia opisujemy w laboratorium grafu wiedzy — zbudowaliśmy je u siebie, więc wyraźnie oddzielamy doświadczenie badawcze od wyników klientów.

Autor
Maciej Szukalski
Założyciel Condictor · architekt systemów · badania i rozwój
Od 2014 roku projektuje i buduje produkty cyfrowe. Specjalizuje się w architekturze, badaniach oraz aplikacjach z warstwami automatyzacji i inteligencji.
Poznaj doświadczenie i sposób pracyMasz problem do rozwiązania?
Sprawdźmy, od czego warto zacząć
Opisz sytuację w kilku zdaniach. Wrócimy z pytaniami lub propozycją konkretnego następnego kroku.
