Cloudflare AI Gateway: logi, DLP i kontrola kosztów AI
Aplikacje, agenci i automatyzacje coraz częściej łączą się z API dostawców modeli AI wprost z kodu, bez centralnego nadzoru zespołu bezpieczeństwa. Cloudflare AI Gateway rozwiązuje dokładnie ten problem: pośredniczy w komunikacji między aplikacją a dostawcą modelu, dzięki czemu cały ten ruch można logować, skanować pod kątem wrażliwych danych i kontrolować pod względem kosztów. W tym artykule pokazujemy, jak działa AI Gateway: jak loguje ruch, jak skanuje go przez DLP i Guardrails, jak pomaga kontrolować koszty, oraz czego nie robi.
Ruch do modeli AI rośnie szybciej niż nadzór nad nim
Według raportu Netskope Cloud and Threat Report 2026, opartego na danych z okresu październik 2024 - październik 2025, liczba pracowników korzystających z aplikacji GenAI potroiła się w ciągu roku, a liczba wysyłanych do nich zapytań wzrosła sześciokrotnie. W tym samym okresie liczba incydentów związanych z wysyłaniem danych wrażliwych do aplikacji AI podwoiła się, do średnio 223 zdarzeń miesięcznie na organizację. Najczęściej wyciekającymi danymi są kod źródłowy, dane objęte regulacjami oraz własność intelektualna.
Znaczna część tego ruchu nie przechodzi już przez przeglądarkę, tylko przez wewnętrzne aplikacje, agentów i automatyzacje, które łączą się z API dostawców modeli wprost z kodu, bez żadnego centralnego nadzoru. Według raportu Salt Security - 1H 2026 State of AI and API Security Report, niemal połowa organizacji (48,9%) nie ma żadnej widoczności ruchu machine-to-machine generowanego przez własnych agentów AI, a 47% ankietowanych organizacji odnotowało wzrost liczby wywołań API o 51-100% w ciągu ostatniego roku. To właśnie tym ruchem zajmuje się Cloudflare AI Gateway i to jemu poświęcona jest reszta tego artykułu.
Czym jest Cloudflare AI Gateway i jak działa
Cloudflare AI Gateway to usługa dostępna na wszystkich planach Cloudflare, która pośredniczy w komunikacji między aplikacją a dostawcą modelu AI. Zamiast łączyć się bezpośrednio z API OpenAI, Anthropic czy Google, aplikacja wysyła zapytanie przez gateway. Ten zapewnia analitykę i logowanie ruchu oraz cache i limity zapytań. Dodatkowo pozwala skonfigurować ponawianie zapytań i przełączanie na model zapasowy w razie błędu dostawcy.
Uruchomienie gatewaya sprowadza się do jednej zmiany w kodzie: zamiast adresu dostawcy aplikacja wskazuje endpoint AI Gateway. Cloudflare udostępnia REST API, które obsługuje dowolny model, także hostowany przez firmy trzecie, przez ten sam interfejs. Nie trzeba instalować dedykowanych SDK dostawców. Uwierzytelnienie odbywa się tokenem API Cloudflare, a rozliczenia, w zależności od wybranego modelu billingu, idą przez konto Cloudflare albo bezpośrednio u dostawcy. Dla najprostszych wdrożeń Cloudflare udostępnia też domyślny gateway o identyfikatorze "default", tworzony automatycznie przy pierwszym zapytaniu, bez wcześniejszej konfiguracji.
Gateway obsługuje ponad dwadzieścia dostawców modeli w trybie natywnym, w tym Workers AI, Amazon Bedrock, Anthropic, Azure OpenAI, Google Vertex AI, Google AI Studio, Mistral, Groq, DeepSeek i OpenAI. Dzięki temu firma korzystająca z kilku modeli jednocześnie widzi cały ruch w jednym miejscu, zamiast rozpraszać go po osobnych integracjach i kontach.
Bezpieczeństwo danych: Guardrails i DLP
Dwie funkcje odpowiadają za bezpieczeństwo treści przechodzących przez gateway. Guardrails (beta) ocenia w czasie rzeczywistym zarówno zapytania użytkowników, jak i odpowiedzi modelu, pod kątem szkodliwych treści, na przykład przemocy, mowy nienawiści czy treści seksualnych. Kategorie do monitorowania konfiguruje się samodzielnie, a wykryta treść może zostać oznaczona do przeglądu lub zablokowana, zanim trafi do modelu albo do użytkownika.
Drugi mechanizm, Data Loss Prevention (beta), korzysta z tych samych silników detekcji co szerszy produkt Cloudflare DLP i skanuje treść zapytań oraz odpowiedzi pod kątem danych wrażliwych, na przykład numerów kart płatniczych czy danych osobowych. Profile DLP są obiektami współdzielonymi na poziomie konta, więc raz skonfigurowane reguły można ponownie wykorzystać w wielu gatewayach, bez definiowania ich od nowa za każdym razem. Jest tu jeden kompromis techniczny: przy odpowiedziach strumieniowanych (SSE) skanowanie DLP wymaga zbuforowania całej odpowiedzi modelu, zanim trafi do klienta, co zwiększa czas do pierwszego tokenu. Jeśli aplikacja potrzebuje niskich opóźnień przy strumieniowaniu, dobrym rozwiązaniem jest ograniczenie DLP wyłącznie do skanowania zapytań albo rozdzielenie ruchu na osobne gatewaye.
DLP jest darmowe na wszystkich planach Cloudflare - konta bez subskrypcji Zero Trust mają dostęp do dwóch gotowych profili: dane finansowe oraz numery identyfikacyjne i ubezpieczeniowe. Ten drugi profil nie obejmuje jednak polskiego PESEL - wykrywanie trzeba skonfigurować samodzielnie jako regułę niestandardową. Guardrails nie ma osobnej opłaty za samą funkcję, ale generuje rozliczane zużycie modelu Workers AI wykorzystywanego do oceny treści.
Domyślnie logi AI Gateway przechowują pełną treść zapytań i odpowiedzi. Nagłówek cf-aig-collect-log-payload: false pozwala wyłączyć zapisywanie samej treści przy zachowaniu metadanych, takich jak liczba tokenów, model, dostawca, kod odpowiedzi czy koszt - to prosty sposób na zachowanie wglądu w użycie bez przechowywania wrażliwych promptów.
Kontrola kosztów, wydajność i odporność
AI Gateway ogranicza koszty i poprawia wydajność na kilku poziomach jednocześnie. Cache przechowuje odpowiedzi dla identycznych zapytań. Klucz cache powstaje z dostawcy, modelu, nagłówka autoryzacji i pełnej treści żądania. TTL cache można ustawić od 60 sekund do miesiąca, a pojedyncze zapytanie może pominąć cache przez nagłówek cf-aig-skip-cache, gdy potrzebna jest zawsze świeża odpowiedź.
Rate limiting pozwala ograniczyć liczbę zapytań w oknie czasowym, w trybie stałym lub kroczącym, zwracając kod 429 po przekroczeniu limitu. Nowsza funkcja, Spend limits (beta), idzie o krok dalej i pozwala ustawić budżet w dolarach, a nie w liczbie zapytań, z podziałem na model, dostawcę lub dowolny wymiar niestandardowy, na przykład identyfikator użytkownika czy zespołu. Po przekroczeniu budżetu gateway może zablokować dalsze zapytania albo, w połączeniu z dynamicznym routingiem, automatycznie przełączyć ruch na tańszy model zamiast go odrzucać. Warto pamiętać, że koszt widoczny w AI Gateway to estymacja wyliczona na podstawie liczby tokenów i cenników dostawców, a nie księgowa wartość rozliczenia - dokładne fakturowanie zależy od samego dostawcy modelu.
Dynamic routing (beta) umożliwia zbudowanie przepływu decyzyjnego, wizualnie albo za pomocą pliku JSON. Można w nim zdefiniować warunki na podstawie metadanych żądania, limity zapytań lub budżetu z automatycznym przełączeniem na model zapasowy, a także rozkład ruchu procentowego przydatny przy testach A/B czy stopniowych wdrożeniach nowego modelu. Razem z konfigurowalną obsługą ponowień i fallbacku, to realna odpowiedź na awarie i przestoje po stronie dostawcy modelu.
Wdrożenie i integracja
Do uwierzytelnienia w AI Gateway wystarczy token API Cloudflare przekazywany w standardowym nagłówku Authorization przy wywołaniach REST API, albo nagłówek cf-aig-authorization przy starszych, natywnych endpointach dostawców. Włączenie funkcji Authenticated Gateway wymusza taki token przy każdym zapytaniu. Dzięki temu nieautoryzowane zapytania są od razu odrzucane.
Rozliczenia można prowadzić na dwa sposoby. Unified Billing pozwala płacić za wywołania modeli bezpośrednio przez konto Cloudflare, bez konieczności zakładania osobnych kont u każdego dostawcy, przy opłacie 5 procent od zakupionych kredytów i bez narzutu na samą cenę tokenów. Alternatywą jest BYOK (bring your own keys), gdzie firma korzysta z własnych, wcześniej wynegocjowanych kluczy API u dostawców, a gateway jedynie pośredniczy w ruchu.
Przy planowaniu wdrożenia trzeba też znać ograniczenia platformy: plan darmowy pozwala utworzyć do 10 gatewayów na koncie, plan płatny do 20, a limit przechowywanych logów wynosi odpowiednio 100 tysięcy na całe konto oraz 10 milionów na gateway, zgodnie z dokumentacją limitów. Pojedynczy log nie może przekroczyć 10 MB, a request podlegający cache'owaniu ma limit 25 MB.
Czego AI Gateway nie robi
AI Gateway widzi wyłącznie ruch, który został przez niego przepuszczony. Nie obejmie więc pracowników korzystających z ChatGPT czy innych publicznych narzędzi AI bezpośrednio w przeglądarce - ten obszar zabezpiecza Cloudflare Gateway z DLP, działający na poziomie ruchu sieciowego urządzeń. Nie zastępuje też zabezpieczeń samej aplikacji: uwierzytelnianie użytkowników końcowych, autoryzacja dostępu do danych i ochrona przed atakami na aplikację pozostają po stronie zespołu, który ją rozwija. Wreszcie, gateway nie jest narzędziem audytu księgowego - koszty w analityce to estymacje, a wiążące rozliczenie zawsze pochodzi od dostawcy modelu albo, przy Unified Billing, z konta Cloudflare.
Jak ICWT pomaga
Wdrożenie AI Gateway to więcej niż zmiana jednego endpointu. W ICWT pomagamy klientom zmapować, które zespoły i aplikacje faktycznie łączą się z modelami AI, dobrać profile DLP i kategorie Guardrails adekwatne do branży i wymogów regulacyjnych (na przykład RODO czy NIS2), oraz skonfigurować limity kosztów i dynamiczny routing tak, aby awaria jednego dostawcy nie zatrzymywała działania aplikacji. Jako partner Cloudflare wspieramy też decyzję między Unified Billing a BYOK, w zależności od tego, jakie umowy z dostawcami modeli firma już ma. Jeśli chcesz sprawdzić, jak to wygląda w Waszej infrastrukturze, skontaktuj się z nami.
Źródła
- Cloudflare AI Gateway - Overview
- Cloudflare AI Gateway - REST API
- Cloudflare AI Gateway - Provider Native
- Cloudflare AI Gateway - Guardrails
- Cloudflare AI Gateway - Data Loss Prevention (DLP)
- Cloudflare AI Gateway - Caching
- Cloudflare AI Gateway - Rate limiting
- Cloudflare AI Gateway - Spend limits
- Cloudflare AI Gateway - Dynamic routing
- Cloudflare AI Gateway - Authenticated Gateway
- Cloudflare AI Gateway - Limits
- Cloudflare AI Gateway - Pricing
- Cloudflare One - Predefined DLP profiles
- Netskope Cloud and Threat Report 2026
- Salt Security - 1H 2026 State of AI and API Security Report
Najczęściej zadawane pytania
Czym różni się AI Gateway od zwykłego API gateway?
AI Gateway rozumie specyfikę ruchu do modeli językowych: liczy tokeny i koszt per model, buduje cache na podstawie treści promptu, a nie tylko adresu URL, oraz oferuje mechanizmy typowe dla AI, takie jak DLP wykrywające wrażliwe dane w zapytaniach i odpowiedziach czy konfigurowalny fallback między modelami różnych dostawców.
Czy wdrożenie AI Gateway wymaga przebudowy aplikacji?
Nie. W większości przypadków wystarczy zmienić adres, pod który aplikacja wysyła zapytania, na endpoint AI Gateway, zachowując dotychczasowy format żądań. Integracje przez Workers Bindings czy popularne SDK wymagają zwykle jednej, dwóch linijek zmian w konfiguracji.
Czy Guardrails i DLP zastępują firmową politykę bezpieczeństwa AI?
Nie. Guardrails i DLP to mechanizmy, które pozwalają wyegzekwować politykę bezpieczeństwa AI - same jej jednak nie definiują. Kategorie Guardrails i profile DLP trzeba samodzielnie skonfigurować pod kątem ryzyk właściwych dla danej organizacji i branży, zgodnie z obowiązującymi regulacjami.
Ile kosztuje korzystanie z AI Gateway?
Podstawowe funkcje - analityka, cache, rate limiting i logi - są darmowe na wszystkich planach Cloudflare. Plan darmowy pozwala utworzyć do 10 gatewayów i przechowywać 100 tysięcy logów na konto, plan płatny do 20 gatewayów i 10 milionów logów na gateway. Guardrails generuje rozliczane zużycie Workers AI, a Unified Billing dolicza 5% opłaty od zakupionych kredytów, bez narzutu na ceny tokenów.
Co się dzieje, gdy dostawca modelu ma awarię?
AI Gateway pozwala skonfigurować automatyczne ponowienia oraz przełączenie na model zapasowy w ramach tego samego lub innego dostawcy. W połączeniu z dynamicznym routingiem można też zdefiniować bardziej złożone reguły przełączania, na przykład na podstawie limitu budżetu albo warunków zapisanych w metadanych żądania.
Powiązane artykuły
Ewolucja Zagrożenia: Dlaczego Shai-Hulud 2.0 zmusza nas do ponownego zdefiniowania Bezpieczeństwa Łańcucha Dostaw Oprogramowania
Analiza ataku Shai-Hulud 2.0 na ekosystem npm — 796 skompromitowanych pakietów, dead man's switch i jak OX Security chroni łańcuch dostaw oprogramowania.
Shai-Hulud znów atakuje npm: keyv i setki pakietów z malware
Złośliwe wersje keyv i powiązanych pakietów npm odpalały się same podczas instalacji, wyciągały sekrety z komputerów deweloperów i runnerów CI, a potem publikowały kolejne zainfekowane paczki. Pokazujemy, jak sprawdzić ekspozycję i co zrobić najpierw.
SAST i DAST: Kompletny przewodnik po nowoczesnym bezpieczeństwie aplikacji
SAST vs DAST - porównanie metod testowania bezpieczeństwa aplikacji. Tabela różnic, kluczowe korzyści i wskazówki wdrożenia dla zespołów DevSecOps.