Press enter to see results or esc to cancel.

Jak utrzymać wydatki na AI na stałym poziomie przy eksplozji zużycia tokenów? Coinbase pokazuje rozwiązanie i używa chińskich modeli

Dyrektor generalny Coinbase, Brian Armstrong, opublikował w serwisie X bardzo szczery i praktyczny wpis. Pokazał, jak jego firma radzi sobie z jednym z największych wyzwań 2026 r. – eksplozją zużycia tokenów przy jednoczesnym utrzymaniu, a nawet obniżeniu kosztów sztucznej inteligencji. Efekt tych działań okazał się znakomity, ponieważ Coinbase obniżyło wydatki na AI niemal o połowę, podczas gdy całkowite zużycie tokenów w firmie kontynuuje silny wzrost. Na załączonym przez niego wykresie widać to wyraźnie: czarna linia oznaczająca zużycie tokenów idzie mocno w górę, a słupki wydatków pozostają znacznie bardziej płaskie, szczególnie w ostatnich miesiącach.

Armstrong opisał konkretne działania, które wdrożył jego zespół. Kluczem do sukcesu okazało się wprowadzenie lepszych modeli domyślnych. Zamiast domyślnie kierować zapytania do drogich modeli frontierowych, takich jak Claude, GPT czy Gemini, Coinbase zaczął korzystać z otwartych modeli chińskich – przede wszystkim GLM 5.2 od Zhipu AI oraz Kimi 2.7 od Moonshot AI. Aż 91% pracowników i tak nie osiągało limitów zużycia, więc zamiast je obniżać i generować frustrację, firma po prostu zmieniła domyślny model na znacznie tańszy.
Kolejnym krokiem było inteligentne routowanie. Giełda stworzyła własne mechanizmy, które analizują prompt przed wysłaniem i kierują go do odpowiedniego modelu. Zadania związane z planowaniem i złożonym rozumowaniem trafiają do droższych modeli frontierowych, natomiast samo wykonanie i powtarzalne zadania obsługują tańsze modele open-weight. Do tego doszło agresywne cachowanie, dzięki któremu wskaźnik cache hit rate w jednym z narzędzi (LibreChat) wzrósł z 5% do 60%. To jeden z najprostszych i najskuteczniejszych sposobów na ograniczenie kosztów. Całość uzupełniło lepsze zarządzanie kontekstem oraz pełna transparentność zużycia wewnątrz firmy.

To nie jest odosobniony przypadek, lecz część szerszego trendu. Działania Coinbase idealnie wpisują się w dane, które od kilku miesięcy widzimy na OpenRouter, czyli największej platformie agregującej dostęp do setek modeli AI. Zgodnie z danymi tej platformy oraz analizami JPMorgan, w 2026 r. chińskie modele open-weight – w tym DeepSeek, Qwen, MiniMax, Kimi oraz GLM – zdominowały zużycie tokenów wśród najpopularniejszych rozwiązań. W niektórych tygodniach chińskie modele odpowiadały za ponad 60% tokenów zużywanych przez dziesięć najpopularniejszych modeli na platformie, podczas gdy udział amerykańskich modeli zamkniętych od OpenAI, Anthropic czy Google drastycznie spadł.
Coinbase nie jest pierwszą dużą firmą, która otwarcie przyznaje się do takiego podejścia. Coraz więcej organizacji dochodzi do wniosku, że nie każdy task wymaga najdroższego modelu na rynku. Przy odpowiednim routingu, cachowaniu i selekcji można osiągnąć 80-90% jakości frontierowego modelu za ułamek ceny.
Dlaczego akurat chińskie modele open-weight wygrywają? Powody są bardzo pragmatyczne. Pierwszym z nich jest cena, często 10- do 20-krotnie niższa niż w przypadku Claude Opus czy GPT-4o przy porównywalnej jakości w wielu zadaniach, szczególnie w kodowaniu, systemach agentowych i długich kontekstach. Format open-weight daje też możliwość fine-tuningu, uruchamiania narzędzi na własnej infrastrukturze i unikania uzależnienia od jednego dostawcy. Chińskie laboratoria wyróżniają się także szybką iteracją, wypuszczając nowe, silniejsze wersje w bardzo krótkim czasie, oraz dobrą jakością w kluczowych zastosowaniach programistycznych.

Amerykańskie modele zamknięte nadal dominują w zadaniach wymagających najwyższej niezawodności, bezpieczeństwa danych czy enterprise compliance. Jednak dla większości codziennej pracy o wysokiej objętości tańsze alternatywy po prostu wygrywają.
Wskazuje to na wyraźne rozdzielenie rynku na dwa segmenty w latach 2026-2027. Segment premium i enterprise rezerwuje drogie modele zamknięte dla zadań krytycznych, natomiast segment high-volume i cost-efficient opiera się na modelach open-weight oraz zaawansowanym routowaniu i cachowaniu. Firmy, które najszybciej opanują tę sztukę, będą w stanie skalować użycie sztucznej inteligencji bez proporcjonalnego wzrostu kosztów.

— Celem nie jest ograniczenie użycia. Celem jest zbudowanie infrastruktury, która sprawia, że wykładniczy wzrost zużycia tokenów jest zrównoważony — podsumował Brian Armstrong.

Wpis szefa Coinbase to jeden z najczystszych sygnałów rynkowych, jakie widzieliśmy w 2026 r. Największa amerykańska firma kryptowalutowa otwarcie przyznaje, że używa chińskich modeli open-weight jako domyślnych, ponieważ ma to sens ekonomiczny. Era bezwarunkowego korzystania z najdroższych rozwiązań do wszystkiego dobiega końca. Zastępuje ją era inteligentnego zarządzania infrastrukturą AI, w której to właśnie chińskie laboratoria zbierają obecnie największe owoce swojego pragmatycznego podejścia.

 

Wykresy:

Piotr Mieczkowski

Helping innovation & digital to grow. TMT expert & advisor.

https://tmt.expert