Bezpieczny asystent AI na własnym serwerze — RAG bez wysyłania danych do chmury

Problem

Lokalny asystent AI w firmie to odpowiedź na realny problem: pracownicy i tak już korzystają z AI — często wklejając do publicznych chatbotów fragmenty umów, cenniki czy dane klientów. Z perspektywy firmy to niekontrolowany wyciek tajemnicy przedsiębiorstwa; z perspektywy RODO — przetwarzanie danych osobowych przez podmiot, z którym nikt nie podpisał żadnej umowy powierzenia.

Zakazy niewiele dają: narzędzie jest zbyt użyteczne. Sensowna odpowiedź brzmi inaczej — dać ludziom asystenta AI, który nie wynosi danych poza firmę.

Jak to działa

Architektura nazywa się RAG (Retrieval-Augmented Generation) i składa się z trzech elementów, z których każdy stoi na Waszym serwerze:

  1. Baza wiedzy — firmowe dokumenty (procedury, umowy, regulaminy, dokumentacja techniczna) zaindeksowane w bazie wektorowej. Dokumenty nie opuszczają serwera.
  2. Model językowy uruchomiony lokalnie — otwarte modele (uruchamiane np. przez Ollama) działają dziś sensownie na pojedynczym serwerze z kartą GPU klasy biznesowej albo — dla mniejszych potrzeb — nawet na mocnym CPU.
  3. Interfejs czatu — pracownik pyta po polsku: „jaka jest procedura reklamacji dla klienta hurtowego?”, a asystent odpowiada na podstawie Waszych dokumentów, z podaniem źródła.

Kluczowa różnica względem publicznych chatbotów: żadne zapytanie ani żaden dokument nie jest wysyłany do zewnętrznego dostawcy. Całość można postawić w sieci wewnętrznej, bez dostępu z internetu.

Na co uważać

  • Jakość zaczyna się od dokumentów. Asystent odpowiada tak dobrze, jak dobra jest baza wiedzy — pierwszym etapem jest uporządkowanie i wybór dokumentów, nie instalacja modelu.
  • Uprawnienia. Jeśli do bazy trafią umowy zarządu, asystent nie może odpowiadać na ich podstawie każdemu pracownikowi. System musi respektować strukturę dostępów.
  • To nie wyrocznia. Lokalny model bywa mniej elokwentny niż wielkie modele chmurowe; jego siłą jest to, że odpowiada na podstawie Waszych dokumentów i wskazuje źródło, które można zweryfikować.

Wniosek biznesowy

Lokalny asystent AI to projekt na tygodnie, nie miesiące — a rozwiązuje dwa problemy naraz: ludzie przestają wklejać poufne dane do publicznych narzędzi, a wiedza zamknięta w setkach dokumentów staje się przeszukiwalna w sekundę. Serwer z GPU to koszt rzędu dobrego laptopa dla handlowca — tyle że pracuje dla całej firmy.

Zastanawiasz się, czy Wasza infrastruktura udźwignie taki projekt — albo od czego zacząć porządkowanie dokumentów? Umów bezpłatną konsultację.

Najczęstsze pytania

Jaki sprzęt jest potrzebny, żeby uruchomić lokalny model językowy?
Kluczowy zasób to pamięć karty graficznej (VRAM), nie sama moc obliczeniowa. Orientacyjna zasada: model w wersji skwantyzowanej (zmniejszonej precyzji, standard przy wdrożeniach lokalnych) potrzebuje w przybliżeniu 1-2 GB VRAM na miliard parametrów. Karta klasy biznesowej z 24-48 GB VRAM obsłuży bez problemu modele średniej wielkości, wystarczające do pracy na firmowej dokumentacji. Mniejsze zastosowania da się uruchomić nawet na mocnym CPU z dużą ilością RAM-u, kosztem czasu odpowiedzi. W praktyce dobór sprzętu to zawsze kompromis między liczbą jednoczesnych użytkowników, oczekiwanym czasem odpowiedzi a budżetem na infrastrukturę.

Czym jest baza wektorowa i dlaczego RAG jej potrzebuje?
Zanim dokumenty trafią do bazy, są dzielone na fragmenty i zamieniane na wektory liczbowe (embeddingi), które oddają znaczenie tekstu, nie tylko dopasowanie słów. Baza wektorowa przechowuje te wektory i w ułamku sekundy znajduje fragmenty najbliższe znaczeniowo zapytaniu pracownika. Dopiero te fragmenty — a nie cała baza wiedzy — trafiają jako kontekst do modelu językowego, który na ich podstawie formułuje odpowiedź. Dzięki temu asystent odpowiada na podstawie faktycznej treści dokumentów, a nie samej pamięci modelu.

Czy taki asystent wymaga stałego dostępu do internetu?
Nie. Po wdrożeniu model językowy, baza wektorowa i interfejs czatu działają wyłącznie na Waszym serwerze — zapytanie pracownika nigdy nie opuszcza firmowej sieci. Dotyczy to również aktualizowania wiedzy: dodanie nowej procedury czy umowy do bazy to lokalna operacja indeksowania, bez wysyłania czegokolwiek na zewnątrz. Jedyny moment, w którym infrastruktura korzysta z internetu, to ewentualne pobranie samego modelu podczas wdrożenia — sama praca asystenta odbywa się offline. W praktyce oznacza to, że awaria łącza internetowego w firmie nie wyłącza asystenta — nadal będzie przeszukiwał firmową dokumentację i odpowiadał na pytania pracowników.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *