pay-per-token (on-demand) lub Provisioned Throughput; modele Anthropic, Amazon Nova, Meta i inne w jednym API
Amazon Bedrock (AWS) rozlicza tokeny on-demand: od $1/1M tokenów wejścia (Claude Haiku 4.5) do $5/1M (Claude Opus 4.5); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -90% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
| Klasa | Model | Wejście / 1M tok. | Wyjście / 1M tok. |
|---|---|---|---|
| Small (routing, klasyfikacja, proste zadania) | Claude Haiku 4.5 | $1.00 | $5.00 |
| Medium (koń roboczy produkcji) | Claude Sonnet 4.5 | $3.00 | $15.00 |
| Frontier (najtrudniejsze zadania, po eskalacji) | Claude Opus 4.5 | $5.00 | $25.00 |
Ceny orientacyjne w USD za 1 milion tokenów (on-demand, bez rabatów). Przeliczenia na PLN po kursie ~4 zł/USD. Dokładne stawki zależą od regionu i wersji modelu.
Policz miesięczny koszt swojego ruchu w trzech chmurach albo przejdź trening architektury oszczędzania: routing modeli, cache, batch, right-sizing kontekstu.
Amazon Bedrock (AWS) rozlicza tokeny on-demand: od $1/1M tokenów wejścia (Claude Haiku 4.5) do $5/1M (Claude Opus 4.5); tokeny wyjściowe są ~4-5x droższe. Batch API daje -50%, a prompt caching -90% na odczycie powtarzalnych tokenów (stan: sierpień 2026).
Batch API (zadania asynchroniczne): -50% ceny tokenów. Prompt/context caching: -90% na odczycie powtarzalnego prefiksu. Provisioned Throughput: stała opłata godzinowa za gwarantowaną przepustowość — opłaca się dopiero przy stabilnym, wysokim ruchu.
Router modeli: klasyfikuj zapytania i kieruj proste do Haiku, złożone do Sonnet, frontier tylko po eskalacji — skala oszczędności wynika z Twojego udziału ruchu prostego i różnicy cen między klasami. Prompt caching na stałym prefiksie (system prompt, definicje narzędzi, kontekst RAG) — cache'owany odczyt kosztuje ułamek pełnej stawki. Wszystko, co nie wymaga odpowiedzi w sekundach (raporty, ETL, ewaluacje), przenieś na Batch API: -50% ceny za samą zmianę trybu wywołania.
Cały ruch na modelu frontier „bo działa najlepiej" — bez routingu 80% zapytań przepłaca 5-15x za zadania, które udźwignie model small. Provisioned Throughput kupiony „na zapas": płacisz za godziny przepustowości także wtedy, gdy ruch śpi (noce, weekendy). Brak prompt cachingu przy długim, powtarzalnym prefiksie (system prompt + RAG) — te same tokeny wejściowe rozliczane pełną stawką tysiące razy dziennie.
Ceny pochodzą z oficjalnych cenników dostawców (stan: sierpień 2026) i są weryfikowane kwartalnie. Przeliczenia na PLN po kursie ~4 zł/USD. Szacunki „ukrytego kosztu iteracji” opierają się na założeniach opisanych w kalkulatorze (250 dni roboczych/rok, ~4 min na iterację) — mają charakter edukacyjny, nie stanowią porady finansowej.
Autor: zespół AI Saver Quest — budujemy symulator promptów z hybrydowym systemem oceny (warstwa deterministyczna + ewaluator LLM) i na co dzień mierzymy realny koszt iteracji w danych z misji treningowych.
Dane: aktualizacja sierpień 2026. Ceny weryfikujemy kwartalnie.