AI-tokens besparen: zo voorkom je onnodig verbruik

Toen ik Claude vaker ging gebruiken, begon ik me ineens te interesseren voor tokens. Ik liep sneller dan verwacht tegen een limiet en extra kosten aan. Tijdens mijn AI-workshops hoor ik inmiddels hetzelfde: “Ik ben alweer door mijn tokens heen.” Dus ben ik tips gaan verzamelen.

Zuinig omgaan met tokens klinkt misschien als iets voor programmeurs. Dat is het niet. Het betekent vooral dat je AI niet meer laat lezen, bedenken en schrijven dan nodig is. Dat bespaart kosten en gebruiksruimte. Vaak worden de antwoorden er ook beter van. En het milieu natuurlijk.

De oplossing is niet: zo kort mogelijk prompten. Een prompt van vijf woorden kan duur uitpakken als je daarna drie keer moet uitleggen wat je bedoelde. De winst zit in je hele werkwijze: model, context, output en documenten.

Wat zijn AI-tokens eigenlijk?

Een taalmodel deelt tekst op in verwerkingseenheden: tokens. Zo’n token kan een woord zijn, maar ook een woorddeel, leesteken of spatie in combinatie met tekst. Een token is dus geen lettergreep en een tokenaantal geen woordenaantal.

Hoe tekst wordt opgeknipt, verschilt per model, codering en taal. OpenAI legt uit dat dezelfde tekst daardoor een ander aantal tokens kan opleveren.

Bij een AI-opdracht kunnen meerdere soorten tokens meetellen:

De transformer-architectuur achter moderne taalmodellen kreeg in 2017 een impuls door het artikel Attention Is All You Need. Hoeveel procent van jouw verbruik uit de prompt komt, zegt dat niet. Daar bestaat geen universele verdeling voor: een korte vraag kan een lange analyse veroorzaken, terwijl een complete instructie direct een kort antwoord oplevert.

Een korte prompt is niet automatisch een zuinige prompt

“Maak hier iets moois van” is kort. Zuinig is het waarschijnlijk niet.

Het model moet dan zelf bedenken wat “mooi” betekent, voor wie het resultaat bedoeld is, welke vorm je wilt en wanneer het antwoord goed genoeg is. De kans is groot dat je daarna gaat corrigeren. Iedere correctieronde voegt context en nieuwe output toe.

Vertel daarom liever meteen:

Een goede prompt mag best wat langer zijn als hij herstelwerk voorkomt. In onze AI-workshops besteden we daarom veel aandacht aan volledige, praktische instructies. Tokenzuinigheid en goed prompten zijn geen tegenpolen. Meestal versterken ze elkaar. Hieronder wat tips.

1. Kies het lichtste model dat de taak aankan

Je zet geen verhuiswagen in om een brood te halen. Toch kiezen veel AI-gebruikers automatisch het zwaarste model dat in het menu staat.

Voor strategische analyse of een complex technisch probleem kan dat verstandig zijn. Voor spellingcontrole, een lijst ordenen of tekst inkorten is het vaak overkill. Zwaardere modellen gebruiken doorgaans meer tijd, gebruiksruimte of geld.

OpenAI adviseert voor kostenoptimalisatie onder meer om het aantal verzoeken te beperken, minder tokens te verwerken en een kleiner model te kiezen zolang de kwaliteit op peil blijft.

Ik werk daarom graag getrapt. Een krachtig model bepaalt de strategie; een lichter model doet de uitwerking. Of begin licht en schakel alleen op wanneer de taak te moeilijk blijkt.

Nieuwer is niet automatisch beter. Test terugkerende taken af en toe opnieuw. Kijk niet alleen naar prijs per miljoen tokens, maar naar kosten per geslaagde taak. Een goedkoop model dat drie pogingen nodig heeft, kan duurder zijn.

Wil je je organisatie laten doorlichten op tokengebruik? Neem contact op.

Comaxx

2. Houd je chats doelgericht

In chats ontstaat ongemerkt ballast. Een gesprek begint met een blog, gaat via een offerte naar een vraag over Excel. Het model krijgt geschiedenis mee die weinig met de nieuwe taak te maken heeft. Dat kan extra verwerking én vreemde antwoorden opleveren.

Niet tevreden? Repareer zo vroeg mogelijk

Gaat een antwoord de verkeerde kant op, pas dan liefst de oorspronkelijke prompt aan of maak vanaf dat punt een nieuwe vertakking, als jouw chatbot dat ondersteunt. Zo blijven mislukte versies niet in de actieve context.

Corrigeer bovendien gericht. Zeg niet: “Schrijf het hele rapport opnieuw.” Zeg: “Pas alleen de tweede alinea onder het kopje ‘Kosten’ aan en laat de rest ongewijzigd.”

Vraag meteen om het echte eindproduct

Wil je drie slides met kernpunten? Vraag dan om drie slides met kernpunten.

Laat niet eerst een rapport van twintig pagina’s maken om dat vervolgens door AI te laten samenvatten tot een presentatie, wat ik in het verleden vaak deed. Bedenk vóór je begint welk eindproduct je werkelijk gebruikt.

Het helpt ook om de gewenste lengte expliciet te maken. Volgens OpenAI’s uitleg over uitvoerlengte kunnen kortere antwoorden kosten en wachttijd beperken. “Geef vijf bullets van maximaal twintig woorden” is duidelijker én zuiniger dan “vertel me alles wat je weet”.

Nieuwe taak? Nieuwe chat (meestal)

Mijn vuistregel is eenvoudig: nieuwe taak, nieuwe chat. Voor een langlopend project maak ik eerst een beknopte overdracht met het doel, de beslissingen, de benodigde feiten en de volgende stap. Daarmee start ik schoon verder.

Niet iedere lange chat is per definitie duurder. Prompt caching kan eerder verwerkte context hergebruiken en kosten en wachttijd verlagen. Maar caching maakt irrelevante geschiedenis nog niet relevant. Compacte context blijft makkelijker te controleren.

Hanteer ook geen magische grens van vijftien of twintig berichten. Een chat met twintig korte, relevante berichten kan prima werken; vijf enorme uploads kunnen al te veel zijn. Kijk naar de inhoud, niet alleen naar het aantal berichtjes.

3. Upload alleen wat AI nodig heeft

Documenten zijn een onderschatte bron van tokenverbruik. We uploaden een rapport van 180 pagina’s en vragen vervolgens naar de conclusie op pagina 47.

Upload liever alleen het relevante hoofdstuk of geef exact aan welke pagina’s onderzocht moeten worden. Verwijder dubbele versies, bijlagen en algemene voorwaarden als ze niets met de vraag te maken hebben.

Bestandsomvang is niet hetzelfde als tokenverbruik

Een Word-bestand van 5 MB gebruikt niet automatisch meer tokens dan een kleiner tekstbestand. Bestandsgrootte kan bestaan uit afbeeldingen, opmaak en metadata; tokenverbruik hangt af van wat het systeem daadwerkelijk aan het model aanbiedt.

Toch zijn eenvoudige bestandsvormen vaak handig:

De keuze voor PDF kan juist méér verwerking vragen. Bij de OpenAI API worden bij geschikte modellen uit een PDF zowel de tekst als afbeeldingen van de pagina’s verwerkt, terwijl uit veel andere documentformaten alleen tekst wordt gehaald. Dat staat expliciet in de documentatie over bestandsinvoer. PDF is dus geen verkeerd formaat, maar wel een formaat dat je bewust moet kiezen.

Vermijd screenshots als tekst beschikbaar is

Loop je vast in software, dan is een screenshot verleidelijk. Maar als de foutmelding, tabel of webpagina selecteerbare tekst bevat, kopieer die tekst dan liever. Beeldinvoer wordt eveneens in tokens omgerekend; resolutie en detailniveau kunnen daarbij verschil maken, zoals de documentatie over beeldinvoer laat zien.

Een screenshot blijft nuttig wanneer de visuele indeling het probleem ís. Tokenzuinigheid betekent niet dat je noodzakelijke informatie weglaat. Het betekent dat je geen beeld laat analyseren als gewone tekst voldoende is.

4. Kijk verder dan de individuele gebruiker

De grootste verspilling zie je soms pas op organisatieniveau. Honderd medewerkers die een te zwaar model gebruiken en lange rapporten genereren, tikken samen stevig aan. Voor analyses op organisatieniveau kan ons AI-team ondersteunen, neem daarvoor contact op.

Is minder tokengebruik ook duurzamer?

In grote lijnen wel, maar maak het niet preciezer dan we kunnen onderbouwen. AI vraagt rekenkracht, koeling en elektriciteit. Het Internationaal Energieagentschap verwacht dat het elektriciteitsgebruik van datacenters richting 2030 sterk stijgt, met AI als belangrijke aanjager. Het energiegebruik verschilt echter per model, hardware, datacenter en taak. Zie Energy and AI van het IEA.

Je kunt daarom niet zeggen dat duizend tokens altijd een vast aantal wattuur of gram CO₂ vertegenwoordigen. Wel is het redelijk om te stellen dat binnen een vergelijkbare taak, met hetzelfde model en dezelfde infrastructuur, minder onnodige verzoeken en verwerking doorgaans minder rekenwerk vragen. Zie het milieuvoordeel vooral als een extra reden om verspilling te voorkomen, hoe nobel het ook lijkt.

Vijf acties waarmee je morgen kunt beginnen

  1. Vraag direct om het eindproduct dat je nodig hebt. Laat geen tussenrapport maken dat daarna weer moet worden ingekort.
  2. Kies het lichtste model dat de taak betrouwbaar uitvoert. Schakel alleen op bij aantoonbare complexiteit.
  3. Houd context klein en relevant. Begin bij een nieuwe taak opnieuw of maak eerst een compacte overdracht.
  4. Upload selectief. Geef alleen de relevante pagina’s, tekst, tabel of afbeelding mee.
  5. Stop met produceren voor de zekerheid. Maak geen lange AI-output zonder duidelijke ontvanger, beslissing of vervolgactie.

Zuinig AI-gebruik is meestal beter AI-gebruik

Wie zuiniger met tokens omgaat, stelt betere vragen. Je kiest bewuster een model, geeft minder ballast mee en vraagt om output die iemand daadwerkelijk gaat gebruiken. Het resultaat is niet alleen goedkoper of sneller. Het is vaak ook scherper.

Het doel is dus niet om ieder woord uit je prompt te persen. Het doel is om onnodige verwerking te voorkomen zonder kwaliteit op te offeren.

Wil je weten waar binnen jouw organisatie tokens, tijd en geld weglekken? Met onze AI-trainingen en strategische ondersteuning helpen we teams om AI praktisch, verantwoord en doelgericht in te zetten.

Veelgestelde vragen over AI-tokens besparen

Wat is een token bij AI?

Een token is een eenheid waarin een AI-model tekst opdeelt, bijvoorbeeld een woord, woorddeel of leesteken. Het aantal hangt af van tekst, taal, tokenizer en model.

Bespaart een kortere prompt altijd AI-tokens?

Niet over de hele taak. De eerste invoer bevat dan minder tokens, maar een te korte of onduidelijke prompt kan extra vragen, correcties en nieuwe antwoorden veroorzaken. Een iets langere, complete instructie kan daardoor per saldo zuiniger zijn.

Hoe bespaar je tokens bij het uploaden van documenten?

Upload alleen de relevante pagina’s of onderdelen. Gebruik platte tekst, Markdown of CSV als opmaak en beelden geen betekenis hebben. Bewaar PDF, Word, PowerPoint of Excel wanneer lay-out, opmerkingen, grafieken, formules of andere documenteigenschappen nodig zijn voor de taak.

Is minder tokengebruik ook duurzamer?

Minder onnodige verwerking en minder overbodige AI-verzoeken vragen binnen vergelijkbare omstandigheden doorgaans minder rekenwerk. De precieze energiebesparing is echter niet rechtstreeks uit een tokenaantal af te leiden, omdat model, hardware, datacenter en taak sterk verschillen.