Neurocourse
En pristabel over ni AI-opgaver: en tekstanmodning $0.0003, læsning af et foto $0.001, et genereret billede $0.04 og otte sekunders Veo-video $3.20.

Hvad koster en AI-anmodning reelt: vi målte ni operationer

9 min read

Den korte version: Den 30. juli 2026 kørte vi ni typer anmodninger gennem Google Vertex AI og loggede token-antallet direkte fra API-svarene. Hovedkonklusionen: at læse er billigt for en AI, at skabe er dyrt, og forskellen er tusindfold. At se en ti-minutters YouTube-video koster to cent. At generere otte sekunders video koster tre dollars tyve. Samme teknologi, samme regning, men operationer af en helt anden karakter – og du kan ikke planlægge et budget uden at forstå den forskel.

Sådan målte vi det

Ikke fra regnemaskiner på marketingsider og ikke fra leverandørers blogløfter. Hver anmodning gik til Vertex AI på vores projekts servicekonto, og fra hvert svar tog vi usageMetadata-blokken – hvor modellen selv rapporterer, hvor mange tokens dit input kostede, og hvor mange dens svar kostede.

Derefter multiplicerede vi med Googles offentliggjorte priser pr. 30. juli 2026 for Gemini 2.5 Flash-Lite-familien: $0.10 per million input tokens (tekst, billeder, video), $0.30 per million audio input tokens og $0.40 per million output tokens. Videogenereringspriser kommer fra Veo 3.1-listen: $0.40 per sekund i standardtilstand.

Metoden er vigtig, fordi den lader dig gentage den: de samme tal findes i svaret på enhver anmodning, du foretager, hvis du ser på usageMetadata.

Tabellen: hvad koster hvad

OperationHvad sker derPris per kørsel
Et tekstspørgsmål~300 tokens ind, ~500 ud$0.0003
Læsning af et fotobillede plus et kort svar$0.001
Transskribering af 30s talelyd koster tre gange tekst$0.0008
Læsning af et afsnit højttalesyntese$0.0006
Visning af en 3-minutters video51k tokens$0.006
Visning af en 10-minutters video171k tokens$0.02
Generering af ét billede1.290 output tokens$0.04
8s video, hurtig tilstandfaktureres per sekund$0.64
8s video, standard tilstandfaktureres per sekund$3.20

Konklusionen: at se er billigere end at skabe

Sammenlign to rækker. At analysere en andens ti-minutters video: to cent. At generere otte sekunder af din egen: tre dollars tyve. Det er 160 gange mere for femoghalvfjerds gange færre sekunder.

Årsagen er, hvordan fakturering fungerer. Alt, hvad du sender til modellen, er input tokens – det billigste på prislisten. Alt, hvad den producerer, er output, og output koster flere gange mere. Med Flash-Lite er input $0.10 per million, og output er $0.40 – fire gange. Billede- og videogenerering faktureres igen separat til helt andre satser.

Derfor reglen, der sparer flest penge: forkort svaret, ikke spørgsmålet. En linje, der siger „svar i ét afsnit“, skærer mere af din regning, end hvis du halverer dit spørgsmål. Den dyreste sætning, du kan skrive til en model, er „forklar i detaljer, med alle eksempler“.

Video, sekund for sekund

Vi målte dette separat ved at trimme et klip til forskellige længder. Modellen tæller video som 258 tokens per sekund video og 25 tokens per sekund lyd. Forholdet er strengt lineært – fem sekunder gav 1.290 tokens, ti sekunder gav præcis 2.580.

LængdeTokensOmkostning at analysere
5 sekunder1.415$0.0002
1 minut17.000$0.002
5 minutter85.000$0.010
10 minutter171.000$0.020

Hvad dette betyder i praksis: at analysere video er ikke en luksus. At trække indholdet ud af en timelang forelæsning koster omkring tolv cent. Din egen tid til at formulere opgaven vil koste mere.

Hvorfor du stadig skal regne på det

En enkelt anmodning koster en brøkdel af en cent, hvilket skaber indtrykket af, at der ikke er noget at tælle. Det indtryk er forkert af to årsager.

For det første: en samtale bliver dyrere for hver besked. Modellen husker ikke tidligere omgange – for at den kan følge konteksten, sendes hele udvekslingen igen med hver anmodning. Din tiende besked trækker de ni forrige med sig, og alle tæller som input igen. Du bliver ved med at skrive lige korte svar, mens regningen stiger af sig selv.

For det andet: nogle sprog koster cirka dobbelt så meget som engelsk. Modellen tæller hverken bogstaver eller ord, men tokens – tekstbidder. Engelsk opdeles i større bidder: ét token er cirka fire tegn der, mens det i mange andre sprog er tættere på to. Den samme tanke koster halvanden til to gange mere.

Hvad du skal gøre ved det

  • Begræns svarets længde eksplicit. „Tre sætninger“, „ét afsnit“, „en liste med fem“ – det er direkte besparelser, ikke stilistisk pilleri.
  • Start en ny chat til en ny opgave. En lang alt-i-én-tråd koster mere end en frisk chat med samme spørgsmål – og fungerer bedre, fordi den forældede kontekst holder op med at være i vejen.
  • Generer ikke, hvad du kan finde. At læse et eksisterende klip eller dokument er næsten altid billigere end at skabe dit eget.
  • For lange tekniske prompts, prøv engelsk. Det handler ikke kun om pris: modeller har primært lært af engelsk tekst og følger en engelsk brief mere præcist.

Forbeholdene, uden hvilke tallene lyver

Vi målte én model – Gemini 2.5 Flash-Lite – på én cloud. Kraftigere modeller koster flere gange mere; konkurrenter har deres egne prislister. Hvad der gælder overalt, er størrelsesordenen og, endnu vigtigere, forholdet mellem operationer: input er billigere end output, læsning er billigere end skabelse.

For det andet: takster ændrer sig. Vores tal er dateret 30. juli 2026. Tjek prisen på leverandørens egen prisside snarere end i artikler – inklusive denne.

🧠Go deeper — in the courseNeurale netværk for begyndere

FAQ

Hvad koster en ChatGPT- eller Gemini-anmodning?

Hvis du bruger en chat-grænseflade på et abonnement, koster det intet ud over abonnementet – grænser tælles i anmodninger, ikke penge. Tallene i denne artikel gælder for API-adgang, hvor en AI er forbundet til din egen software, og du betaler per token: $0.0003 for et tekstspørgsmål, $0.001 for at læse et foto, $0.04 for et genereret billede.

Hvorfor koster billedgenerering mere end at læse fotos?

Fordi det er operationer af en anden art. At læse et billede betyder at sende det som input, og input tokens er det billigste på listen. At skabe et billede betyder at producere output, som faktureres separat og meget højere. I vores målinger koster et genereret billede $0.04, mens læsning af et foto koster $0.001 – fyrre gange mindre.

Hvad koster AI-analyse af en YouTube-video?

Målt den 30. juli 2026 med Gemini 2.5 Flash-Lite: 258 tokens per sekund video plus 25 tokens per sekund lyd. Et ti-minutters klip svarer til cirka 171.000 tokens, cirka $0.02. En times video koster omkring tolv cent.

Er det sandt, at videogenerering koster dollars per sekund?

Ja. Veo 3.1 faktureres per sekund: $0.40 per sekund i standardtilstand og fra $0.05 i lite-tier. Et otte-sekunders klip koster $3.20 i standardtilstand – mere end at analysere hundrede og halvtreds timers andres video.

Hvordan reducerer jeg AI-omkostninger uden at miste kvalitet?

Tre vaner gør det meste af arbejdet. For det første: begræns svarets længde eksplicit, da output tokens koster fire gange input. For det andet: start en ny chat til en ny opgave – hele historikken sendes igen med hver besked. For det tredje: generer ikke, hvad du kan finde og læse i stedet.

Hvorfor koster tekst på nogle sprog mere end engelsk?

Modellen tæller hverken bogstaver eller ord, men tokens – tekstbidder. Engelsk opdeles i større bidder: cirka fire tegn per token, mod omkring to i mange andre sprog. Den samme tanke bruger halvanden til to gange flere tokens og koster proportionalt mere.

Hvor kan du se, hvor mange tokens din egen forespørgsel brugte?

API-svaret indeholder en usageMetadata-blok, hvor modellen rapporterer antal input- og output-tokens, opdelt efter modalitet: text, image, video, audio. Alle tal i denne artikel kom derfra, og du kan gentage målingen på dine egne forespørgsler.