Azure OpenAI Service i Google Vertex AI rozliczają tokeny w podobnym modelu on-demand; różnice, które realnie widać na fakturze, to rabat prompt cachingu (Azure OpenAI Service: -75%, Google Vertex AI: -75%), model zobowiązań przepustowości i katalog dostępnych modeli. Batch API w obu daje -50%. Większość oszczędności pochodzi z architektury (routing modeli, cache, batch), która działa identycznie w obu chmurach (stan: sierpień 2026).
| Kryterium | Azure OpenAI Service | Google Vertex AI |
|---|---|---|
| Model rozliczeń | pay-per-token (standard) lub PTU (Provisioned Throughput Units); modele OpenAI w regionach Azure z integracją Entra ID i private networking | pay-per-token; Gemini + modele partnerskie (m.in. Anthropic) w Model Garden, integracja z BigQuery i GKE |
| Klasa small (wej./wyj.) | GPT-4o mini: $0.15/$0.6 za 1M tok. | Gemini Flash: $0.15/$0.6 za 1M tok. |
| Klasa medium | GPT-4o: $2.5/$10 za 1M tok. | Gemini Pro: $1.25/$10 za 1M tok. |
| Klasa frontier | o1: $15/$60 za 1M tok. | Claude Opus 4.5 (partner): $5/$25 za 1M tok. |
| Rabat Batch API | -50% | -50% |
| Rabat prompt caching | -75% na odczycie | -75% na odczycie |
| Zobowiązania przepustowości | PTU: rezerwujesz jednostki przepustowości (rozliczenie godzinowe lub miesięczne) — przewidywalny koszt, ale płacisz też za niewykorzystane moce | Provisioned Throughput dla Gemini oraz Committed Use Discounts przy zobowiązaniu rocznym — sens dopiero przy stabilnym wolumenie |
Azure OpenAI Service i Google Vertex AI rozliczają tokeny w podobnym modelu on-demand; różnice, które realnie widać na fakturze, to rabat prompt cachingu (Azure OpenAI Service: -75%, Google Vertex AI: -75%), model zobowiązań przepustowości i katalog dostępnych modeli. Batch API w obu daje -50%. Większość oszczędności pochodzi z architektury (routing modeli, cache, batch), która działa identycznie w obu chmurach (stan: sierpień 2026).
Azure OpenAI Service: rabat -75% na odczycie cache'owanych tokenów wejściowych (vs -75% u drugiego). Im wyższy rabat, tym bardziej opłaca się restrukturyzacja promptów pod stały prefiks.
Zwykle nie — główna część oszczędności leży w architekturze (routing modeli, cache, Batch API, budżet kontekstu), która działa w obu chmurach. Migracja to najdroższy i najbardziej ryzykowny sposób na oszczędność, którą w większości osiągniesz bez niej.
Policz swój pełny koszt AI albo zacznij trening, który zmniejsza liczbę iteracji — niezależnie od tego, które narzędzie wybierzesz.
Ceny pochodzą z oficjalnych cenników dostawców (stan: sierpień 2026) i są weryfikowane kwartalnie. Przeliczenia na PLN po kursie ~4 zł/USD. Szacunki „ukrytego kosztu iteracji” opierają się na założeniach opisanych w kalkulatorze (250 dni roboczych/rok, ~4 min na iterację) — mają charakter edukacyjny, nie stanowią porady finansowej.
Autor: zespół AI Saver Quest — budujemy symulator promptów z hybrydowym systemem oceny (warstwa deterministyczna + ewaluator LLM) i na co dzień mierzymy realny koszt iteracji w danych z misji treningowych.
Dane: aktualizacja sierpień 2026. Ceny weryfikujemy kwartalnie.