Neurocourse
En pristabell för nio AI-operationer: textförfrågan $0.0003, läsa foto $0.001, genererad bild $0.04, åtta sekunder Veo-video $3.20

Vad en AI-förfrågan faktiskt kostar: vi mätte nio operationer

9 min read

Kortversionen: den 30 juli 2026 körde vi nio typer av förfrågningar via Google Vertex AI och loggade tokenantalet direkt från API-svaren. Huvudfyndet: att läsa är billigt för en AI, att skapa är dyrt, och skillnaden är tusenfaldig. Att titta på en tio minuter lång YouTube-video kostar två cent. Att generera åtta sekunder video kostar tre dollar tjugo. Samma teknik, samma faktura, men operationer av helt olika karaktär – och du kan inte planera en budget utan att förstå den skillnaden.

Så mätte vi det

Inte från kalkylatorer på marknadsföringssidor och inte från leverantörers blogglöften. Varje förfrågan gick till Vertex AI på vårt projekts tjänstekonto, och från varje svar tog vi usageMetadata-blocket – där modellen själv rapporterar hur många tokens din input kostade och hur många dess svar kostade.

Sedan multiplicerade vi med Googles publicerade priser per den 30 juli 2026 för Gemini 2.5 Flash-Lite-familjen: $0.10 per miljon input-tokens (text, bilder, video), $0.30 per miljon audio input-tokens och $0.40 per miljon output-tokens. Priser för videogenerering kommer från Veo 3.1-listan: $0.40 per sekund i standardläge.

Metoden är viktig eftersom den låter dig upprepa den: samma siffror finns i svaret på varje förfrågan du gör, om du tittar på usageMetadata.

Tabellen: vad kostar vad

OperationVad händerKostnad per körning
En textfråga~300 tokens in, ~500 ut$0.0003
Läsa ett fotobild plus ett kort svar$0.001
Transkribera 30 sekunder talljud kostar tre gånger text$0.0008
Läsa ett stycke högttalsyntes$0.0006
Titta på en 3-minuters video51k tokens$0.006
Titta på en 10-minuters video171k tokens$0.02
Generera en bild1 290 output-tokens$0.04
8 sekunder video, snabblägedebiteras per sekund$0.64
8 sekunder video, standardlägedebiteras per sekund$3.20

Fyndet: att titta är billigare än att skapa

Jämför två rader. Att analysera någon annans tio minuter långa video: två cent. Att generera åtta sekunder av din egen: tre dollar tjugo. Det är 160 gånger mer för sjuttiofem gånger färre sekunder.

Anledningen är hur debiteringen fungerar. Allt du skickar till modellen är input-tokens – det billigaste på prislistan. Allt den producerar är output, och output kostar flera gånger mer. Med Flash-Lite är input $0.10 per miljon och output $0.40 – fyra gånger. Bild- och videogenerering debiteras separat igen, med helt andra priser.

Därav regeln som sparar mest pengar: förkorta svaret, inte frågan. En rad som säger ”svara i ett stycke” minskar din faktura mer än att halvera din fråga gör. Den dyraste frasen du kan skriva till en modell är ”förklara i detalj, med alla exempel”.

Video, sekund för sekund

Vi mätte detta separat genom att klippa en video till olika längder. Modellen räknar video som 258 tokens per sekund bildmaterial och 25 tokens per sekund ljud. Sambandet är strikt linjärt – fem sekunder gav 1 290 tokens, tio sekunder gav exakt 2 580.

LängdTokensKostnad att analysera
5 sekunder1 415$0.0002
1 minut17 000$0.002
5 minuter85 000$0.010
10 minuter171 000$0.020

Vad detta betyder i praktiken: att analysera video är ingen lyx. Att extrahera innehållet från en timmeslång föreläsning kostar cirka tolv cent. Din egen tid för att formulera uppgiften kommer att kosta mer.

Varför du fortfarande måste räkna

En enskild förfrågan kostar en bråkdel av en cent, vilket skapar intrycket att det inte finns något att räkna på. Det intrycket är fel av två skäl.

För det första: en konversation blir dyrare för varje meddelande. Modellen minns inte tidigare turer – för att den ska följa sammanhanget skickas hela utbytet igen med varje förfrågan. Ditt tionde meddelande drar med sig de nio tidigare, och alla räknas som input igen. Du fortsätter att skriva lika korta svar medan fakturan klättrar av sig själv.

För det andra: vissa språk kostar ungefär dubbelt så mycket som engelska. Modellen räknar varken bokstäver eller ord utan tokens – textbitar. Engelska delas upp i större bitar: en token är ungefär fyra tecken där, medan den i många andra språk är närmare två. Samma tanke kostar en och en halv till två gånger mer.

Vad du kan göra åt det

  • Begränsa svarets längd explicit. ”Tre meningar”, ”ett stycke”, ”en lista med fem” – det är direkta besparingar, inte stilistiskt petande.
  • Starta en ny chatt för en ny uppgift. En lång allt-i-ett-tråd kostar mer än en ny chatt med samma fråga – och fungerar bättre, eftersom det gamla sammanhanget slutar vara i vägen.
  • Generera inte det du kan hitta. Att läsa ett befintligt klipp eller dokument är nästan alltid billigare än att skapa ditt eget.
  • För långa tekniska prompts, prova engelska. Det handlar inte bara om pris: modeller har lärt sig mest från engelsk text och följer en engelsk brief mer exakt.

Förbehållen, utan vilka siffrorna ljuger

Vi mätte en modell – Gemini 2.5 Flash-Lite – på en molnplattform. Kraftfullare modeller kostar flera gånger mer; konkurrenter har sina egna prislistor. Vad som gäller överallt är storleksordningen och, viktigare, förhållandet mellan operationer: input är billigare än output, att läsa är billigare än att skapa.

För det andra: tariffer ändras. Våra siffror är daterade den 30 juli 2026. Kontrollera priset på leverantörens egen prissida snarare än i artiklar – inklusive denna.

🧠Go deeper — in the courseNeurala nätverk för nybörjare

FAQ

Vad kostar en enskild ChatGPT- eller Gemini-förfrågan?

Om du använder ett chattgränssnitt via en prenumeration kostar det inget utöver prenumerationen – gränser räknas i förfrågningar, inte pengar. Siffrorna i denna artikel gäller för API-åtkomst, där en AI är kopplad till din egen programvara och du betalar per token: $0.0003 för en textfråga, $0.001 för att läsa ett foto, $0.04 för en genererad bild.

Varför kostar det mer att generera en bild än att läsa tio foton?

Eftersom de är operationer av olika slag. Att läsa en bild innebär att skicka den som input, och input-tokens är det billigaste på listan. Att skapa en bild innebär att producera output, vilket debiteras separat och är mycket dyrare. I våra mätningar kostar en genererad bild $0.04 medan att läsa ett foto kostar $0.001 – fyrtio gånger mindre.

Vad kostar det att låta en AI analysera en YouTube-video?

Mätt den 30 juli 2026 med Gemini 2.5 Flash-Lite: 258 tokens per sekund bildmaterial plus 25 tokens per sekund ljud. Ett tio minuter långt klipp blir cirka 171 000 tokens, ungefär $0.02. En timmes video kostar cirka tolv cent.

Stämmer det att videogenerering kostar dollar per sekund?

Ja. Veo 3.1 debiteras per sekund: $0.40 per sekund i standardläge och från $0.05 i lite-nivån. Ett åtta sekunder långt klipp kostar $3.20 i standardläge – mer än att analysera hundrafemtio timmar av någon annans video.

Hur minskar jag AI-kostnaderna utan att förlora kvalitet?

Tre vanor gör det mesta av jobbet. För det första, begränsa svarets längd explicit, eftersom output-tokens kostar fyra gånger mer än input. För det andra, starta en ny chatt för en ny uppgift – hela historiken skickas om med varje meddelande. För det tredje, generera inte det du kan hitta och läsa istället.

Varför kostar text på vissa språk mer än engelska?

Modellen räknar varken bokstäver eller ord, utan tokens – textbitar. Engelska delas upp i större bitar: ungefär fyra tecken per token, jämfört med cirka två i många andra språk. Samma tanke kräver en och en halv till två gånger fler tokens, och kostar proportionerligt mer.

Var kan jag se hur många tokens min egen förfrågan använde?

API-svaret innehåller ett usageMetadata-block där modellen rapporterar antal input- och output-tokens, uppdelat per modalitet: text, bild, video, ljud. Alla siffror i den här artikeln kom därifrån, och du kan upprepa mätningen på dina egna förfrågningar.