Datum: 30.07.2026
SSL sertifikat: šta je, kako radi i zašto ga vaš sajt mora imati
SSL sertifikat potvrđuje identitet sajta. Saznajte kako radi, koje vrste postoje i koji je pravi za vaš biznis.
Blog
05.08.2026.
AI za firmu se najčešće naplaćuje po tokenu, jedinici teksta koju model pročita ili napiše. Ulazni i izlazni tokeni obračunavaju se odvojeno, po ceni izraženoj na milion tokena. Za srednju firmu u Srbiji mesečni trošak samog modela najčešće se meri desetinama do nekoliko stotina dolara, a ne hiljadama.
Problem je što skoro nijedan tekst na srpskom ne dođe do te cifre. Ovaj tekst dolazi. Uzećemo tri scenarija koje verovatno prepoznajete iz sopstvene firme, pretvoriti ih u tokene i izračunati mesečni račun po cenama koje su javno objavljene na Orion AI Factory servisu za inferenciju po potrošnji.
Cena AI rešenja zaista zavisi od obima, integracija i održavanja. To je tačan odgovor, ali nepotpun. Firmi koja priprema budžet ne treba objašnjenje zašto je procena teška, nego okvir u kome može sama da proceni.
Kada postoji broj, menja se i razgovor. Umesto pitanja da li je AI skup, dolaze konkretna pitanja: koliko operacija imamo mesečno, koliko to nosi tokena i da li nam se isplati. Na takva pitanja finansije umeju da odgovore.
Prema istraživanju koje prenosi ICT Hub, samo oko trećine kompanija u Srbiji koristi veštačku inteligenciju, a visoki troškovi implementacije navode se među glavnim preprekama. Dobar deo te prepreke je neizvesnost. Kada se trošak izrazi u jedinici koja se meri, procena prestaje da bude pretpostavka.
Zato je potrebna jedinica u kojoj se taj trošak meri.
Model ne naplaćuje pitanja ni razgovore. Naplaćuje tokene, komadiće teksta koji su otprilike veličine sloga ili kratke reči. Svaki poziv ka modelu ima dve strane:
Izlazni tokeni su po pravilu skuplji, često tri do četiri puta. Razlog je tehnički. Ulaz se obradi u jednom prolazu, dok se izlaz generiše token po token, pa svaki novi token zahteva poseban ciklus računanja. Ako vas zanima šta se tačno dešava u tom trenutku, pogledajte tekst o tome šta je AI inference.

Postoji i detalj koji se u domaćim tekstovima nikada ne pominje, a direktno vas košta. Tokenizacija nije jednako efikasna na svim jezicima. Studija koja meri tokenizaciju na 24 evropska jezika pokazuje da slovenski jezici troše između 2,2 i 2,5 tokena po reči, dok romanski ostaju na 1,5 do 1,7, a germanski na 1,7 do 1,9. Bogata morfologija, padeži i nastavci lome reči na više delova.
Praktično: isti sadržaj na srpskom generiše osetno više tokena nego na engleskom. U računicama ispod koristimo 2,3 tokena po reči.
Za osećaj razmere, jedna A4 strana poslovnog teksta ima između 300 i 500 reči, dakle otprilike 700 do 1.150 tokena na srpskom. Ugovor od deset strana ulazi u model kao oko 9.000 tokena. Sistemski prompt sa uputstvima, tonom komunikacije i pravilima obično staje između 500 i 5.000 tokena, i ponavlja se u svakom pozivu.
Cene se izražavaju po milionu tokena, odvojeno za ulaz i izlaz. Za tri modela dostupna kroz Orion AI Factory tarifa izgleda ovako:
| Model | Ulazni token (1M) | Izlazni token (1M) |
| Kimi K2.7 | $1,00 | $4,00 |
| GLM 5.2 | $1,00 | $4,00 |
| DeepSeek V4 Flash | $0,50 | $1,50 |
Razlika između najskupljeg i najjeftinijeg reda nije mala. Za zadatke poput klasifikacije tiketa, izvlačenja podataka iz dokumenata ili sažimanja, jeftiniji model najčešće radi posao jednako dobro. Skuplji model čuvajte za korake gde stvarno treba rezonovanje.
Sve pretpostavke su navedene. Zamenite ih svojim brojevima i računica ostaje ista.
Pretpostavke: prosečan tiket ima četiri razmene. U svakom pozivu šaljete sistemski prompt i delove baze znanja, oko 1.500 tokena. Korisnikovo pitanje je oko 40 reči, dakle oko 90 tokena. Odgovor je oko 120 reči, oko 280 tokena.
Ključni detalj: istorija razgovora se šalje ponovo u svakoj razmeni. Zato poslednji poziv ima skoro dvostruko veći ulaz od prvog, iako je pitanje iste dužine.
| Razmena | Ulazni tokeni | Izlazni tokeni |
| 1. | 1.590 | 280 |
| 2. | 1.960 | 280 |
| 3. | 2.330 | 280 |
| 4. | 2.700 | 280 |
| Ukupno | 8.580 | 1.120 |
Mesečni trošak modela: oko $2,60 (Kimi ili GLM), odnosno oko $1,19 (DeepSeek).

Pretpostavke: ugovori i izveštaji od osam strana, oko 7.200 tokena po dokumentu, plus 400 tokena uputstva sa šemom podataka. Model vraća strukturirani izvod, oko 400 tokena.
Ovo je ulazno dominantan posao. Šaljete mnogo, dobijate malo. Kod ovakvih zadataka cena ulaznog tokena odlučuje o računu, pa se izbor jeftinijeg modela oseti dvostruko više nego kod chata.
Mesečni trošak modela: oko $4,60 (Kimi ili GLM), odnosno oko $2,20 (DeepSeek).
Pretpostavke: 30 ljudi, osam upita dnevno, 22 radna dana. To je 5.280 upita mesečno. Svaki upit nosi sistemski prompt i kontekst povučen iz interne dokumentacije, oko 2.600 tokena ulaza, i odgovor od oko 350 tokena.
Mesečni trošak modela: oko $21 (Kimi ili GLM), odnosno oko $10 (DeepSeek).
| Scenario | Ulazni tokeni | Izlazni tokeni | Kimi / GLM | DeepSeek |
| Podrška, 200 tiketa | 1,72M | 0,22M | ~$2,60 | ~$1,19 |
| 500 dokumenata | 3,80M | 0,20M | ~$4,60 | ~$2,20 |
| Asistent, 30 zaposlenih | 13,73M | 1,85M | ~$21,13 | ~$9,65 |

Ako vam se ove cifre čine premalim, niste u manjini. Upravo to je nalaz koji nedostaje domaćim tekstovima o ceni AI.
Obratite pažnju i na odnos ulaza i izlaza. U sva tri scenarija ulazni tokeni čine većinu potrošnje, u obradi dokumenata i preko 90 odsto. To je važno jer se optimizacija najčešće usmerava na skraćivanje odgovora, dok se prava ušteda krije u onome što šaljete, a ne u onome što dobijate.
Male cifre iznad važe dok se kontekst drži pod kontrolom. Čim prestane, rastu brzo.
Prvi razlog je gomilanje istorije. U razgovoru koji ima više razmena, svaki novi poziv nosi sve prethodno. Merenja koja prenosi Cloudchipr pokazuju da do desete razmene jedan poziv košta oko sedam puta više nego prvi, za isti odgovor. Ako vaš chatbot vodi duge razgovore i nikada ne sažima istoriju, plaćate isti tekst desetinama puta.
Drugi razlog je sistemski prompt. Ako ste u njega ubacili celu politiku reklamacija i cenovnik, taj teret ide uz svaki poziv. Sto poziva dnevno sa promptom od 5.000 tokena je 15 miliona tokena mesečno pre nego što je iko postavio pitanje.
Treći razlog su AI agenti. Agent ne šalje jedan poziv, već pokreće lanac poziva, poziva alate i sam sebe proverava. Potrošnja po zadatku raste višestruko u odnosu na običan chatbot. Zato agentske tokove treba puštati sa jasnim budžetom po zadatku, ne sa neograničenom potrošnjom.
Poređenje koje sledi je važnije od svih računica.
Ako je mesečni trošak modela za podršku od 200 tiketa oko tri dolara, jasno je da to nije stavka koja odlučuje o vašem budžetu. Odlučuje sve ostalo:
Ti troškovi se u praksi mere stotinama i hiljadama evra, i za razliku od tokena, ne padaju sami od sebe.
Iz toga slede dva zaključka. Prvi: nema smisla birati AI provajdera prvenstveno po ceni tokena kada je ta stavka jednocifrena. Važnije je da li imate kontrolu nad podacima, pouzdan API i predvidive performanse. Drugi zaključak se češće previđa: nema smisla ni odlagati testiranje zbog straha od troška modela. Taj strah je skoro uvek neopravdan, a naplata po potrošnji ga i formalno uklanja, jer bez saobraćaja nema ni računa.
Ono što jeste opravdano je pitanje šta se dešava kada obim poraste sto puta. Kontakt centar sa 20.000 tiketa mesečno ili proizvod sa desetinama hiljada korisnika izlazi iz opsega ovog teksta. Tada trošak modela postaje ozbiljna stavka i optimizacija se brzo isplati.
Ako vam je rezultat ispod sto dolara mesečno, trošak modela nije razlog da ne krenete.
Naplata po potrošnji ima jasnu prednost dok je obim promenljiv ili nepoznat. Plaćate ono što potrošite, bez minimalne obaveze i bez nabavke opreme.
Tačka preokreta dolazi kada potrošnja postane velika i, što je važnije, ravnomerna. Firma koja svakog dana troši isti veliki broj tokena u nekom trenutku počinje da razmišlja o rezervisanom kapacitetu (eng. reserved capacity). Gde je tačno ta granica i šta ulazi u poređenje, obradićemo u posebnom tekstu.
Za sve ostale, a to je većina firmi koje tek uvode AI, računica sa početka ovog teksta i dalje važi.
Cena AI za firmu nije nepoznanica. Meri se u jedinici koju vam niko nije objasnio, pa deluje kao rizik. Kada se ta jedinica prevede u tokene i pomnoži tarifom, dobija se broj koji staje u budžet bez rasprave.
Ako želite da proverite sopstvenu računicu na konkretnim modelima i tarifama, pogledajte šta obuhvata Pay as you go usluga Orion telekoma.
Manje nego na engleskom. Slovenski jezici troše između 2,2 i 2,5 tokena po reči zbog padeža i bogate morfologije, dok romanski jezici ostaju na 1,5 do 1,7. Za grubu procenu na srpskom pomnožite broj reči sa 2,3.
Ulazni tekst model obradi u jednom prolazu. Izlaz generiše token po token, pa svaki novi token traži poseban ciklus računanja na grafičkim procesorima. Zbog toga je cena izlaznog tokena obično tri do četiri puta veća.
Sam trošak modela je mali. Za 200 tiketa mesečno sa četiri razmene po tiketu, računica daje oko tri dolara mesečno. Veći deo budžeta odlazi na pripremu baze znanja, integraciju sa tiketing sistemom i održavanje.
Za promenljiv ili nepoznat obim, plaćanje po potrošnji je jeftinije jer nema minimalne obaveze ni nabavke. Rezervisani kapacitet postaje isplativ tek kada je potrošnja istovremeno velika i ravnomerna kroz mesec.
Skratite sistemski prompt, sažimajte istoriju razgovora umesto da je šaljete celu, koristite jeftiniji model za jednostavne korake i ograničite dužinu odgovora. Kod ponovljenih promptova pomaže i keširanje ulaza.