„AI Cost Control w chmurze” to kurs AI Saver Quest dla architektów i zespołów platformowych: routing modeli, prompt caching na powtarzalnym prefiksie, Batch API dla ruchu nieinteraktywnego i right-sizing kontekstu — z uwzględnieniem różnic między Amazon Bedrock, Azure OpenAI i Google Vertex AI. 5 lekcji z misjami na scenariuszach produkcyjnych.
Ten sam wolumen zapytań może różnić się kosztem o rząd wielkości w zależności od tego, jak zaprojektowano przepływ: czy prefiks jest cache'owany, czy ruch nieinteraktywny idzie przez Batch API, czy każde zapytanie trafia do modelu frontier, i ile kontekstu wysyłasz naprawdę. Kurs przechodzi te cztery dźwignie po kolei, na liczbach.
Trzy platformy mają inne rabaty za odczyt z cache i za Batch, inne modele dostępności i inne mechanizmy limitów. Kurs porównuje je na tym samym scenariuszu, żeby decyzja o providerze wynikała z liczb dla Twojego profilu ruchu, a nie z tego, gdzie masz już konto. Aktualne przeliczenia znajdziesz też w otwartym porównaniu kosztów chmurowych na tej stronie.
Misje kodowe i ewaluacyjne uruchamiają się w sandboxie na ukrytym zestawie przypadków — piszesz na przykład politykę routingu albo funkcję budżetu kontekstu, a ocena wynika z przejścia testów, nie z opisu rozwiązania. Kilka misji dotyczy cost review: dostajesz scenariusz i szukasz, gdzie ucieka budżet.
Dla architektów, platform engineerów i techleadów odpowiadających za rachunek za AI w systemie produkcyjnym. Wymaga rozumienia, skąd bierze się koszt jednego wywołania — jeśli tego brakuje, wcześniej warto przejść Agent Economics.
Najczęściej największą pojedynczą dźwignią jest prompt caching na powtarzalnym prefiksie, bo w systemach z RAG i narzędziami prefiks stanowi dominującą część tokenów wejściowych. Drugą jest routing: skierowanie prostych zapytań do tańszego modelu. Obie zmiany są zwykle mniejsze niż tydzień pracy.
Do ruchu, który nie musi odpowiadać interaktywnie: raporty, wzbogacanie danych, ewaluacje modeli, klasyfikacja wsadowa. Nie nadaje się do ścieżki użytkownika. Kurs pokazuje, jak rozdzielić te dwa strumienie bez duplikowania logiki.
Zależy od profilu ruchu: przy dużym powtarzalnym prefiksie decydują rabaty za odczyt z cache, przy ruchu wsadowym — rabaty Batch. Dlatego kurs uczy liczyć własny scenariusz zamiast podawać jedną odpowiedź, która zdezaktualizuje się przy najbliższej zmianie cenników.
Metoda liczenia jest niezależna od cen, a dane cenowe używane w kalkulatorach na tej stronie są weryfikowane kwartalnie z datą aktualizacji podaną jawnie. Kurs uczy modelu, nie zapamiętywania stawek.
2 z 5 lekcji są otwarte w planie Free. Pozostałe, razem z misjami kodowymi i cost review, wchodzą w plan Pro.
O części FinOps dotyczącej obciążeń AI: mierzeniu i obniżaniu kosztu inferencji przez decyzje projektowe. Nie obejmuje ogólnego FinOpsu chmury (instancje, storage, sieć).