Przejdź do treści
Condictor Studio
AI
AI

Czym jest RAG i kiedy się opłaca

RAG przed odpowiedzią pobiera trafne materiały i przekazuje je modelowi jako kontekst. Zobacz, kiedy pomaga, czym różni się od fine-tuningu i ile kosztuje.

Około 4 min czytaniaautor
Przepływ zapytania: pytanie trafia do zbioru pociętych dokumentów, kilka najbliższych fragmentów wraca do modelu, a ten zwraca odpowiedź z odnośnikiem do źródła

RAG (Retrieval-Augmented Generation) to technika, w której system przed sformułowaniem odpowiedzi wyszukuje trafne materiały i przekazuje je modelowi jako kontekst. Dzięki temu odpowiedź może korzystać z aktualnych danych spoza parametrów modelu i wskazywać źródła. Nazwę oraz podstawowy mechanizm opisali Lewis i współautorzy w pierwotnej pracy o RAG z 2020 roku.

To jest cała idea. Reszta tego wpisu to konsekwencje, koszty i pułapki.

Jak RAG działa krok po kroku

Pięć etapów. Przygotowanie źródeł i indeksu powtarza się po zmianach materiału, a wyszukiwanie i generowanie — przy pytaniu:

  1. Zbieranie źródeł. Dokumenty, umowy, procedury, wątki mailowe, tabele. Jednorazowo, potem cyklicznie przy aktualizacjach.
  2. Podział i opis materiału. Dokument dzieli się według jego struktury, a fragmenty dostają metadane. Wpływ rozmiaru fragmentu trzeba sprawdzić w ewaluacji; nie istnieje jedna dobra długość dla wszystkich źródeł.
  3. Indeksowanie. W popularnym wariancie fragmenty dostają reprezentacje wektorowe; indeks może też obsługiwać wyszukiwanie słów, filtrów i metadanych. Dobór mechanizmu zależy od pytań.
  4. Wyszukiwanie przy pytaniu. System pobiera kandydatów metodą wektorową, tekstową, hybrydową albo zapytaniem do ustrukturyzowanego źródła i może ponownie ustawić ich kolejność.
  5. Generowanie i kontrola odpowiedzi. Model dostaje pytanie oraz znaleziony materiał. Produkcyjna implementacja powinna wskazywać źródła i mieć regułę odmowy lub eskalacji, gdy podstawa jest niewystarczająca.

Sama instrukcja nie gwarantuje posłuszeństwa modelu, dlatego potrzebne są cytaty możliwe do sprawdzenia, kryterium wystarczającej podstawy i poprawna odpowiedź „brak danych”. RAG może ograniczać konfabulacje, ale ich nie usuwa.

RAG czy fine-tuning? Tabela decyzyjna

RAG i fine-tuning mogą się uzupełniać, ale ich główne zastosowania są inne. RAG dostarcza materiał w czasie odpowiedzi, a strojenie zmienia zachowanie modelu na podstawie przykładów; samo strojenie nie jest niezawodnym magazynem aktualnej, cytowalnej wiedzy.

RAGFine-tuning
Odpowiada na pytanie„co jest w naszych danych”„w jakim stylu i formacie odpowiadać”
Aktualizacja wiedzyodśwież indeks po zmianie źródłazwykle wymaga nowego cyklu strojenia
Podanie źródłamożna powiązać odpowiedź z pobranym fragmentemnie wynika ze strojenia; wymaga osobnego mechanizmu
Koszt wejściazależy od źródeł, uprawnień i ewaluacjizależy od danych treningowych i procesu strojenia
Zmiana modelu bazowegowymaga ponownej ewaluacji wyszukiwania i odpowiedzimoże wymagać ponownego strojenia i ewaluacji

Reguła praktyczna: aktualną, cytowalną wiedzę zwykle łatwiej dostarczać przez wyszukiwanie, a format i zachowanie kształtować instrukcją, przykładami lub strojeniem. Te techniki można łączyć; wybór potwierdza się testem na docelowych zadaniach.

Co decyduje o tym, czy RAG działa dobrze

Cztery obszary do wspólnego testowania; ich wpływ zależy od źródeł i rodzaju pytań:

  • Stan źródeł. Sprzeczne wersje procedury mogą dostarczyć sprzeczne podstawy. Potrzebne są wersjonowanie, właściciel dokumentu i reguła pierwszeństwa źródeł.
  • Sposób cięcia i wzbogacania fragmentów. Fragment bez kontekstu („punkt 4.2 nie dotyczy klientów z grupy B”) jest bezużyteczny albo szkodliwy. Fragmenty opatrujemy metadanymi: skąd pochodzą, z jakiej wersji, kogo dotyczą.
  • Jakość wyszukiwania. Samo podobieństwo wektorowe może słabiej obsługiwać nazwy własne, numery i symbole. Wyszukiwanie hybrydowe oraz reranking są hipotezami do sprawdzenia na zestawie pytań, nie automatyczną receptą.
  • Ewaluacja. Zestaw pytań z oczekiwanymi odpowiedziami, uruchamiany po każdej zmianie. Bez tego „poprawiliśmy” znaczy „zmieniliśmy i mamy nadzieję”.

Kiedy RAG się nie sprawdzi

  • Gdy wiedzy nie da się wiarygodnie pozyskać. Tekst można indeksować bezpośrednio, a obrazy lub skany po ekstrakcji albo w potoku multimodalnym. Jeśli odpowiedź siedzi wyłącznie w głowie jednej osoby, najpierw trzeba ją udokumentować.
  • Gdy pytania wymagają liczenia lub agregacji. „Ilu klientów odeszło w czerwcu” to zapytanie do bazy, nie do samego wyszukiwania semantycznego. Potrzebna jest warstwa analityczna albo kontrolowany mechanizm tworzenia i walidowania zapytań.
  • Gdy pytania wymagają obliczeń lub przechodzenia po relacjach. „Które umowy z tym podwykonawcą kończą się przed audytem” lepiej obsłuży zapytanie do danych ustrukturyzowanych, czasem wspierane przez graf wiedzy, niż samo podobieństwo fragmentów.
  • Gdy mały, stabilny zbiór mieści się bezpiecznie w kontekście. Podanie całości może być prostsze od pipeline’u, o ile koszt, uprawnienia i jakość odpowiedzi przejdą test.

Ile kosztuje wdrożenie RAG

Nasze widełki na sierpień 2026 r.: pilotaż na wycinku wiedzy 12 000–30 000 zł netto (orientacyjnie 3–5 tygodni, z ewaluacją), produkcyjny system z integracją 30 000–120 000 zł netto, utrzymanie jakości 2 000–6 000 zł netto/mc.

Do tego dochodzi bieżący koszt modeli i infrastruktury, zależny między innymi od wolumenu, długości kontekstu, pamięci podręcznej i ponowień. Pilotaż pozwala zmierzyć jakość, wykorzystanie przez użytkowników oraz koszt na własnych danych przed decyzją o produkcji.

Najczęstsze pytania

Czy nasze dokumenty trafią do trenowania modelu?

RAG sam tego nie rozstrzyga. Dokumenty mogą zostać w Twojej bazie, ale pobrane fragmenty nadal trafiają do wybranego modelu. Użycie do trenowania, retencja i miejsce przetwarzania zależą od usługi, planu i umowy. Te warunki trzeba sprawdzić przed wdrożeniem.

Czy RAG usuwa halucynacje?

Ogranicza je, nie usuwa. Model wciąż może źle zinterpretować fragment albo odpowiedzieć, gdy powinien powiedzieć „nie wiem”. Dlatego wymuszamy cytowanie źródła i mierzymy, jak często system odpowiada bez podstawy.

Ile źródeł trzeba mieć, żeby zaczęło to mieć sens?

Nie ma minimalnej liczby źródeł. Policz częstotliwość i koszt wyszukiwania, ryzyko błędnej odpowiedzi, jakość dokumentów oraz koszt budowy i utrzymania. Mały zbiór może uzasadniać prostsze wyszukiwanie lub podanie całego kontrolowanego kontekstu zamiast pełnego pipeline'u.


RAG i grafy wiedzy to technologie; dla Ciebie liczy się efekt, który nazywamy second brain dla firm. Własne narzędzia opisujemy w laboratorium grafu wiedzy — zbudowaliśmy je u siebie, więc wyraźnie oddzielamy doświadczenie badawcze od wyników klientów.

Maciej Szukalski

Autor

Maciej Szukalski

Założyciel Condictor · architekt systemów · badania i rozwój

Od 2014 roku projektuje i buduje produkty cyfrowe. Specjalizuje się w architekturze, badaniach oraz aplikacjach z warstwami automatyzacji i inteligencji.

Masz problem do rozwiązania?

Sprawdźmy, od czego warto zacząć

Opisz sytuację w kilku zdaniach. Wrócimy z pytaniami lub propozycją konkretnego następnego kroku.

Opisz swój temat

Zobacz też

Wszystkie artykuły