pay-per-token; Gemini + modele partnerskie (m.in. Anthropic) w Model Garden, integracja z BigQuery i GKE
Google Vertex AI (Google Cloud) rozlicza tokeny on-demand: od $0.15/1M tokenów wejścia (Gemini Flash) do $5/1M (Claude Opus 4.5 (partner)); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -75% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
| Klasa | Model | Wejście / 1M tok. | Wyjście / 1M tok. |
|---|---|---|---|
| Small (routing, klasyfikacja, proste zadania) | Gemini Flash | $0.15 | $0.60 |
| Medium (koń roboczy produkcji) | Gemini Pro | $1.25 | $10.00 |
| Frontier (najtrudniejsze zadania, po eskalacji) | Claude Opus 4.5 (partner) | $5.00 | $25.00 |
Ceny orientacyjne w USD za 1 milion tokenów (on-demand, bez rabatów). Przeliczenia na PLN po kursie ~4 zł/USD. Dokładne stawki zależą od regionu i wersji modelu.
Policz miesięczny koszt swojego ruchu w trzech chmurach albo przejdź trening architektury oszczędzania: routing modeli, cache, batch, right-sizing kontekstu.
Google Vertex AI (Google Cloud) rozlicza tokeny on-demand: od $0.15/1M tokenów wejścia (Gemini Flash) do $5/1M (Claude Opus 4.5 (partner)); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -75% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
Batch API (zadania asynchroniczne): -50% ceny tokenów. Prompt/context caching: -75% na odczycie powtarzalnego prefiksu. Provisioned Throughput dla Gemini oraz Committed Use Discounts przy zobowiązaniu rocznym — sens dopiero przy stabilnym wolumenie.
RAG zamiast długiego kontekstu: 5-10 trafnych fragmentów po retrievalu zamiast 500k tokenów „całej dokumentacji" w każdym wywołaniu. Context caching tylko dla gorących, współdzielonych kontekstów (wysoki hit-rate) — licz opłatę za przechowywanie w rachunku opłacalności. Gemini Flash jako domyślny model routingu i klasyfikacji — przy tych cenach warstwa routera kosztuje grosze, a chroni budżet frontier.
Milionowy kontekst Gemini kusi wrzucaniem całych baz wiedzy do promptu — płacisz za każdy token wejścia przy każdym zapytaniu, zamiast raz zbudować retrieval. Context caching ma opłatę za przechowywanie: cache trzymany „na wszelki wypadek" dla rzadko odpytywanego kontekstu kosztuje więcej, niż oszczędza. Grounding i narzędzia dodatkowe (search, code execution) rozliczane osobno — łatwo przeoczyć w estymacji, bo nie widać ich w cenniku tokenów.
Ceny pochodzą z oficjalnych cenników dostawców (stan: sierpień 2026) i są weryfikowane kwartalnie. Przeliczenia na PLN po kursie ~4 zł/USD. Szacunki „ukrytego kosztu iteracji” opierają się na założeniach opisanych w kalkulatorze (250 dni roboczych/rok, ~4 min na iterację) — mają charakter edukacyjny, nie stanowią porady finansowej.
Autor: zespół AI Saver Quest — budujemy symulator promptów z hybrydowym systemem oceny (warstwa deterministyczna + ewaluator LLM) i na co dzień mierzymy realny koszt iteracji w danych z misji treningowych.
Dane: aktualizacja sierpień 2026. Ceny weryfikujemy kwartalnie.