AIGATO.

Kunstig intelligens · Regulering · Hva det betyr for Norge

AI-laber og teknologiselskaperPublisert 20. juli 2026

Apple ML Research har laget en metode som lar AI-modeller styre sin egen svarleengde token for token

Length Value Model økte lengdepresisjon fra 30,9 til 64,8 poeng på en 7B-modell — og beholdt 63 prosent korrekthet med et budsjett på 200 tokens, mot seks prosent for standardmetoden.

TIMUR AKTAS · Ansvarlig redaktør · 20. juli 2026
AI-generert · redaksjonelt kontrollert

Antall tokens en modell genererer avgjør både kostnad og responstid. Apple ML Research undersøker nå hvordan modeller kan lære å styre dette selv. Illustrasjonsfoto.

Hver gang en AI-modell svarer, betaler noen for hvert ord den skriver. Apple ML Research har publisert en metode som gir modellen løpende kontroll over sin egen svarleengde — token for token — uten at kvaliteten faller dramatisk. Forskningen peker mot billigere og mer forutsigbare AI-systemer.

Hvert ord koster penger

En kundeservicebot som svarer med tre avsnitt i stedet for én setning, bruker tre til fem ganger så mange tokens — og regningen følger proporsjonalt. Hos ledende API-leverandører prises utgangstokens vesentlig høyere enn inngang: Claude Sonnet 4 tar femten dollar per million utgangstokens mot tre dollar for inngang.

Løsningene har til nå vært grove. Et fast tak på antall tokens risikerer å kutte midt i et resonnement; ingen begrensning gir ordflom og tilsvarende kostnad. Apple ML Research presenterer en tredje vei.

Verdien av hvert enkelt token

Metoden kalles Length Value Model, eller LenVM, og behandler lengdestyring som et verdiestimeringsproblem fra forsterkningslæring — den grenen av maskinlæring der en agent lærer av konsekvensene av egne handlinger.

Hvert genererte token tildeles en konstant negativ belønning. Ved hvert steg i genereringen beregner modellen en forventet fremtidig kostnad basert på hvor mange tokens den antar å trenge for å fullføre svaret. Resultatet er et kontinuerlig signal som forteller modellen om den er på vei mot et for langt eller for kort svar.

Dette skiller seg fra tidligere tilnærminger, som ifølge Apple ML Research har operert på sekvensnivå: modellen vurderer lengden samlet, ikke steg for steg. LenVM gir det forskerne beskriver som «tett, upartisk og skalerbar» veiledning, og krever ingen manuell merking av treningsdataene.

Resultatene fra testene

Forskerne testet metoden på LIFEBench, et benchmark som måler hvor presist en språkmodell følger eksplisitte lengdeinstruksjoner på tvers av oppgavetyper som spørsmål-og-svar, oppsummering og resonnering.

På en 7B-modell — sju milliarder parametere, i det mindre sjiktet av moderne språkmodeller — økte lengdescoren fra 30,9 til 64,8. Apple ML Research hevder dette overgår de fremste lukkede kommersielle modellene på samme test. Resultatene er selskapets egne og er ikke uavhengig verifisert.

På matematikkbenchmarken GSM8K, med et budsjett på 200 tokens per svar, opprettholdt LenVM 63 prosent korrekthet. Standardmetoden for å begrense utgangslengde klarte seks prosent under de samme betingelsene. Også dette er selskapets egne tall.

Forskningen viser i tillegg at LenVM kan forutsi total svarleengde allerede fra det punktet der brukerens spørsmål slutter — før modellen har skrevet et eneste ord av svaret.

Tolkbare signaler

Verdisignalene i LenVM kan visualiseres token for token. Forskerne beskriver dette som et «tolkbart vindu» inn i generingsdynamikken: man kan se hvilke ord som skyver modellen mot kortere eller lengre respons.

For virksomheter som bruker AI i produksjon — i kundeservice, juridisk analyse eller dokumentgenerering — gir det muligheten til å undersøke uventet atferd og forstå hvorfor en modell begynner å svare med dobbelt så mange ord som forventet.

Apples bredere AI-strategi

Forskningen henger sammen med Apples kommersielle interesser. Selskapet har gjort effektiv lokal AI-behandling til et konkurranseargument: egne kjernebrikker i iPhone og Mac er designet for å kjøre AI-modeller direkte på enheten. Lokal behandling koster ingenting per token, mens skybasert behandling gjør det — en asymmetri som gir sterk motivasjon til å maksimere ytelsen innenfor stramme ressursrammer.

På WWDC 2026 lanserte Apple rammeverket Core AI, som skal gjøre det enklere for utviklere å kjøre store språkmodeller — inkludert resoneringsmodeller med opptil 70 milliarder parametere — direkte på Apple-enheter, uten serveravhengighet og uten per-token skykostnader, ifølge selskapet.

LenVM passer inn i dette bildet: en metode som lar en relativt liten modell opptre presist innenfor en gitt ressursramme, er særlig verdifull når den rammen er enhetens eget minne og prosessor.

Implikasjoner for tokenbasert prising

For virksomheter som betaler for AI-API-er basert på tokenforbruk, er den praktiske implikasjonen direkte: lengdestyring er kostnadstyring. Selskaper med høye volumer av automatiserte svar — i support, rapportgenerering eller dataanalyse — kan spare betydelig på modeller som bruker akkurat nok tokens.

LenVM er publisert som forskningsartikkel og er ikke et ferdig produkt. Apple har ikke annonsert noen dato for eventuell integrering i Apple Intelligence eller andre produkter. Metoden er beskrevet som kompatibel med forsterkningslæring-basert trening, noe forskerne fremhever som en mulig vei mot fremtidig bruk i RL-baserte treningsrammer.

Forskergruppen inkluderer bidragsytere fra University of California Santa Barbara, Carnegie Mellon University og LMSYS Org — organisasjonen som driver Chatbot Arena, en av de mest brukte plattformene for uavhengig sammenligning av språkmodeller.

Få dette rett i innboksen

De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.

Kun nyhetsbrevet, ingen spam. Meld deg av når som helst.

Kilde: https://machinelearning.apple.com/research/length-value-model
Bakgrunnskilder: LIFEBench: Evaluating Length Instruction Following in Large Language Models (arXiv) · Apple Launches Core AI for Apple-Silicon Optimized On-Device Generative AI (InfoQ) · Apple doubling-down on on-device AI at WWDC 2026 (AppleInsider) · LLM Token Optimization: Cut Costs & Latency in 2026 (Redis)

Apple ML Research har laget en metode som lar AI-modeller styre sin egen svarleengde token for token · AIGATO