„Multimodal Economics” to kurs AI Saver Quest o kosztach modalności innych niż tekst: jak dostawcy przeliczają obraz na tokeny, ile kosztuje minuta audio i transkrypcji, kiedy zdjęcie w prompcie jest tańsze od opisu, a kiedy dużo droższe. 6 lekcji z misjami liczbowymi na realnych scenariuszach.
Obraz nie jest rozliczany „za sztukę” — dostawcy przeliczają go na tokeny według rozdzielczości i sposobu kafelkowania. Jedno zdjęcie w wysokiej rozdzielczości bywa droższe niż kilka stron tekstu, a różnica między trybem niskiej i wysokiej szczegółowości potrafi być wielokrotna. To pozycja, której nie widać w cenniku wyrażonym „za milion tokenów”.
Najdroższy wzorzec to wysyłanie zrzutu ekranu tam, gdzie wystarczyłby tekst — na przykład screenshot tabeli zamiast CSV. Model musi wtedy zapłacić za rozpoznanie tego, co i tak miałeś w formie strukturalnej. Kurs pokazuje, jak wychwycić te miejsca w istniejącym systemie i ile zwraca ich naprawienie.
Są zadania, w których obraz redukuje koszt: zamiast opisywać layout w tysiącu tokenów, wysyłasz jeden zrzut w niskiej szczegółowości. Kurs nie mówi „unikaj obrazów”, tylko daje kryterium: porównaj koszt tokenów obrazu z kosztem opisu, który musiałbyś napisać, plus koszt iteracji wynikających z nieporozumienia.
Dla osób budujących systemy, które przetwarzają dokumenty, zdjęcia lub nagrania: zespołów produktowych, developerów i architektów. Wymaga rozumienia modelu kosztowego z Agent Economics — bez tego liczby nie będą miały do czego się odnieść.
Kalkulator kosztów AI na tej stronie liczy scenariusze API na Twoich wolumenach, a otwarte porównanie cen narzędzi i chmury podaje aktualne stawki wejścia i wyjścia. Zacznij od liczby, którą płacisz dziś — kurs ma sens wtedy, gdy wiesz, co optymalizujesz.
Zależy od rozdzielczości i trybu szczegółowości: dostawcy przeliczają obraz na tokeny wejściowe, więc koszt jednego zdjęcia w trybie wysokiej szczegółowości może odpowiadać kilku tysiącom tokenów tekstu. Dokładne przeliczenie dla popularnych modeli robi kalkulator kosztów na tej stronie.
Zwykle taniej jest najpierw transkrybować dedykowanym modelem rozliczanym za czas, a dopiero tekst wysłać do modelu językowego. Wysyłanie audio bezpośrednio ma sens, gdy potrzebujesz informacji, które w transkrypcji ginąc — ton, przerwy, nakładające się głosy.
Do dokumentów o przewidywalnej strukturze — zwykle tak, bo OCR jest rzędy wielkości tańszy. Model wizyjny wygrywa przy dokumentach nieustrukturyzowanych, gdzie liczy się rozumienie układu, a nie samo odczytanie znaków. Kurs podaje kryterium wyboru zamiast reguły ogólnej.
Nie — to jedyny kurs na platformie w całości objęty planem Pro. Bezpłatnie możesz natomiast policzyć swój scenariusz w kalkulatorze kosztów AI i sprawdzić prompt w darmowej ocenie w 5 wymiarach.
Kurs uczy metody przeliczania, nie stawek. Dane cenowe używane w kalkulatorach na tej stronie są weryfikowane kwartalnie, z datą aktualizacji podaną jawnie przy każdym zestawieniu.
Od policzenia dwóch wariantów na papierze: model multimodalny kontra łańcuch tańszych narzędzi (OCR lub transkrypcja plus model tekstowy). Kurs prowadzi przez to porównanie na realnych scenariuszach, żeby decyzja architektoniczna zapadła przed wdrożeniem, nie po pierwszej fakturze.