pay-per-token (standard) lub PTU (Provisioned Throughput Units); modele OpenAI w regionach Azure z integracją Entra ID i private networking
Azure OpenAI Service (Microsoft Azure) rozlicza tokeny on-demand: od $0.15/1M tokenów wejścia (GPT-4o mini) do $15/1M (o1); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -75% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
| Klasa | Model | Wejście / 1M tok. | Wyjście / 1M tok. |
|---|---|---|---|
| Small (routing, klasyfikacja, proste zadania) | GPT-4o mini | $0.15 | $0.60 |
| Medium (koń roboczy produkcji) | GPT-4o | $2.50 | $10.00 |
| Frontier (najtrudniejsze zadania, po eskalacji) | o1 | $15.00 | $60.00 |
Ceny orientacyjne w USD za 1 milion tokenów (on-demand, bez rabatów). Przeliczenia na PLN po kursie ~4 zł/USD. Dokładne stawki zależą od regionu i wersji modelu.
Policz miesięczny koszt swojego ruchu w trzech chmurach albo przejdź trening architektury oszczędzania: routing modeli, cache, batch, right-sizing kontekstu.
Azure OpenAI Service (Microsoft Azure) rozlicza tokeny on-demand: od $0.15/1M tokenów wejścia (GPT-4o mini) do $15/1M (o1); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -75% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
Batch API (zadania asynchroniczne): -50% ceny tokenów. Prompt/context caching: -75% na odczycie powtarzalnego prefiksu. PTU: rezerwujesz jednostki przepustowości (rozliczenie godzinowe lub miesięczne) — przewidywalny koszt, ale płacisz też za niewykorzystane moce.
Hybryda: baza ruchu na PTU (przewidywalny koszt), piki na standard pay-per-token — zamiast wymiarować rezerwację pod szczyt. Prompt caching na powtarzalnym prefiksie i krótkie max_tokens tam, gdzie odpowiedź ma być zwięzła — tokeny wyjściowe są 4x droższe. Batch API dla zadań offline i mini-modele (GPT-4o mini) jako domyślne — eskalacja do o1 tylko dla zadań, które realnie wymagają reasoning.
PTU wymiarowane pod szczyt ruchu zamiast pod bazę — najdroższa forma „spokoju": rezerwa stoi bezczynnie przez większość doby. Modele reasoning (o1) do zwykłych zadań: płacisz też za niewidoczne tokeny rozumowania, których nie ma w odpowiedzi. Deployment per zespół bez wspólnych limitów i tagowania kosztów — rachunek rośnie, a nikt nie wie, który produkt go generuje.
Ceny pochodzą z oficjalnych cenników dostawców (stan: sierpień 2026) i są weryfikowane kwartalnie. Przeliczenia na PLN po kursie ~4 zł/USD. Szacunki „ukrytego kosztu iteracji” opierają się na założeniach opisanych w kalkulatorze (250 dni roboczych/rok, ~4 min na iterację) — mają charakter edukacyjny, nie stanowią porady finansowej.
Autor: zespół AI Saver Quest — budujemy symulator promptów z hybrydowym systemem oceny (warstwa deterministyczna + ewaluator LLM) i na co dzień mierzymy realny koszt iteracji w danych z misji treningowych.
Dane: aktualizacja sierpień 2026. Ceny weryfikujemy kwartalnie.