Slik fungerer kontekstvinduet og tokens i Claude Code

Hvorfor koster samme spørsmål 2 kroner i en fersk økt og 16 i en lang? Lær hva tokens er, hva som fyller kontekstvinduet, hvordan caching hjelper og hva /context og /usage viser.

Publisert

Utdrag fra nettkurset «Claude Code – komplett guide»Av

Du stiller Claude Code et lite spørsmål, «forklar kort hva getLoansForBorrower gjør», i to forskjellige økter. Den ene er fersk. Den andre har du jobbet i hele dagen. Svaret blir omtrent det samme. Prisen er ikke det: det ene spørsmålet kostet rundt to kroner, det andre rundt seksten. Forskjellen er kontekstvinduet, og det er verdt ti minutter å forstå.

Kontekstvinduet er et skrivebord

Claude har ikke noe minne av seg selv. Den vet bare det den ser akkurat nå, og alt den ser kalles konteksten. Tenk på et skrivebord: alt som ligger der kan Claude se og bruke, og det som ikke ligger der, finnes ikke. Kontekstvinduet er størrelsen på bordet, og i dag er standarden typisk en million tokens.

Bordet er ikke tomt når du starter en økt. Der ligger allerede systeminstruksjoner, prosjektinstruksjoner fra CLAUDE.md, minne, verktøylisten og beskrivelsene av skills. Så kommer meldingene dine, filene Claude leser, resultatene av kommandoene den kjører, og svarene den gir. Alt havner på bordet, og Claude leser hele bordet på nytt for hver melding du sender. Den svarer ikke bare på det siste du skrev.

Se ditt eget kontekstvindu med /context

Skriv skråstrek og /context, så får du en visualisering av økten du står i. I kurset viste en helt fersk økt, der eneste oppgave var å spørre hva prosjektet handler om, allerede 50 000 tokens, altså fem prosent av vinduet. Mesteparten var systemverktøy, deretter meldinger, minnefiler, systemprompt og skills. En stor økt lå på 400 000 tokens, og der var det meldingene frem og tilbake som dominerte.

Hva et token er

Claude behandler ikke tekst som hele ord og setninger. Teksten deles i små biter som kalles tokens: et helt ord, en del av et ord, eller bare et tegn. Det Claude leser er input-tokens. Det Claude skriver tilbake er output-tokens, og de koster vesentlig mer. Størrelsen på kontekstvinduet måles i tokens, og jo mer som ligger der, desto flere tokens må Claude forholde seg til hver gang.

Slik henger kontekst og pris sammen

Prisen for en melding er, grovt sagt, alle input-tokens Claude må lese, delt på en million, ganget med prisen per million for modellen. I kurset brukes rundt 45 kroner per million input-tokens for Opus som regneeksempel:

  • Fersk økt: 47 000 tokens gir omtrent 2 kroner.
  • Lang økt: 374 000 tokens gir omtrent 16 kroner, for nøyaktig samme spørsmål.

I den lange økten leser Claude alt som ligger der, vurderer om noe er relevant for det lille spørsmålet, konkluderer med nei, og svarer. Alt ble lest forgjeves. Regnestykket gjelder direkte hvis du betaler per token via API. Bruker du Claude Code gjennom et abonnement, får du ingen regning per forespørsel, men den samme ressursbruken avgjør hvor mye du får ut av planen din.

Caching gjør det billigere å fortsette

Heldigvis betaler du ikke full pris for hele bordet hver gang. Claude Code bruker prompt caching: kontekst som ikke har endret seg, gjenbrukes langt billigere. I kursets eksempel koster 500 000 vanlige input-tokens rundt 22 kroner, mens de samme tokenene lest fra cache koster litt over 2. Så lenge du fortsetter å sende meldinger, holdes cachen varm.

Obs: Cachen er midlertidig. Med et abonnement beholdes den normalt i én time og fornyes mens du jobber. Tar du en lang pause og kommer tilbake til samme økt, er den kald, og alt må leses på nytt til full pris.

Følg med på forbruket med /usage

Du trenger ikke regne selv. Kommandoen /usage viser kostnaden for økten og hva som har spist av grensene dine daglig og ukentlig. I kurset kom 58 prosent av kursholderens forbruk fra økter med mange subagenter, altså ultracode, xhigh og workflows, og 47 prosent fra økter der kontekstvinduet hadde vokst forbi 150 000 tokens. Rapporten avslutter med et tips du bør ta til deg: lange økter er dyrere selv med cache, så komprimer midt i en oppgave og start friskt når du bytter oppgave.

Når bordet blir fullt

Nærmer vinduet seg fullt, komprimerer Claude Code automatisk. Alt på bordet kokes ned til det viktigste, detaljer forsvinner, og du kan jobbe videre. Du kan trigge det selv med /compact. I kurset frigjorde det 400 000 tokens i én operasjon. Det viktigste å huske: et fullt bord er ikke et bedre bord. Det du vil ha, er de riktige tingene på bordet.

Neste steg

Når du bør komprimere, når du bør starte ny økt, og hvordan du forgrener en økt med verdifull kontekst, får du i Slik bruker du /compact, /clear og /fork i Claude Code. Den faste delen av bordet, prosjektinstruksjonene, styrer du med CLAUDE.md. Og vil du forstå kontekstvinduet i KI-modeller generelt, forklarer Hva er kontekstvinduet i en KI-modell grunnlaget.

Denne videoen er hentet fra kurset Claude Code – komplett guide på Utdannet.no. I det fulle kurset ser du /context og /usage på ekte økter, regner ut kostnaden i et regneark, og lærer hvordan modellvalg og tenkenivå påvirker forbruket.

Om kursholderen

Espen Faugstad kursholder hos Utdannet.no

Gründer av Utdannet.no

Ekspert på digital kompetanse med over 160 nettkurs – fra Google Ads og Analytics til Adobe-programmer og kunstig intelligens. Gründer av Utdannet.no og en av Norges mest erfarne formidlere av digital læring, med over 1,5 millioner videoavspillinger. Har levert kurs og opplæring for virksomheter som NKI, NITO, NHO, NAV, Polaris Media og Adresseavisen. Forfatter av læreboken «Lær Photoshop i en fei» utgitt på Fagbokforlaget i 2015. Kursene er bygget på praktisk læring med konkrete eksempler – tilpasset både nybegynnere og viderekomne.