AI-laber og teknologiselskaperPublisert 22. juli 2026
AWS presenterer treningsmetode som bevarer resonneringsevnen under domenefinjustering
SDR lar modellen generere sine egne resonneringsspor – og unngår at generell matematikk- og resonneringsevne forsvinner under tilpasning til nye domener
Når en språkmodell finjusteres på domenespesifikke data uten mellomliggende tankespor, kan generell resonneringsevne kollapse nesten fullstendig. AWS presenterer Self-Distilled Reasoning (SDR), en treningsmetode der modellen selv genererer de manglende sporene – uten manuell annotering og uten separat lærermodell.
Et advokatfirma vil bruke Nova 2 Lite til å gjennomgå kontraktsklausuler. De har tusenvis av eksempler på inndata og riktige svar, men ingen dokumenterte resonneringsspor mellom dem. Standard finjustering gir nedslående resultater: modellen løser den nye oppgaven, men matematikk-scoren faller fra 70 til 6 prosent, ifølge AWSs egne eksperimenter beskrevet i selskapets ML-blogg.
Problemet er kjent som «katastrofisk glemming» og er et reelt hinder for virksomheter som vil tilpasse store språkmodeller til egne domener. AWS-teamet bak Nova 2-familien presenterer SDR som en løsning: teknikken krever verken manuelt annoterte resonneringsspor i treningsdataene eller en separat lærermodell.
Snarveien modellen tar
Under standard supervisert finjustering (SFT) av en resonneringsmodell beregnes tapsfunksjonen over alle tokens. Når treningsdataene kun inneholder inndata og fasitsvar – uten mellomliggende tankespor – lærer modellen å hoppe over resonneringssteget. AWS betegner dette som «reasoning suppression»: modellen mister evnen til å resonnere under inferens, selv når resonneringsmodus eksplisitt aktiveres.
Effekten er ikke marginal. AWSs eksperimenter viser at standard SFT med resonneringsmodus aktivert kan gi over 17 prosentpoeng høyere måldomene-nøyaktighet enn trening uten resonnering – men bare dersom treningsdataene faktisk inneholder resonneringsspor. Uten slike spor forsvinner gevinsten, og de generelle evnene med den.
Modellen som sin egen lærer
SDR omgår problemet ved at Nova 2 Lite-grunnmodellen selv genererer de manglende resonneringssporene. Prosessen har tre steg: grunnmodellen kjøres mot hvert eksempel i treningsdatasettet og produserer et chain-of-thought-spor; sporet settes foran fasitsvaret i treningsdataene; deretter finjusteres modellen med resonneringsmodus aktivert, slik at den trenes på både tankesporet og sluttsvaret.
Metoden krever ingen menneskelig annotering, ingen separat lærermodell og ingen etterfølgende modellsammenslåing. SDR fungerer på eksisterende SFT-datasett uavhengig av domene – juridiske dokumenter, medisinske flervalgsspørsmål, fakturabilder – og kan implementeres via Amazon Bedrock Converse API.
AWS tilbyr to varianter for å konstruere sporene. «Basic reasoning» lar modellen resonnere fremover fra spørsmålet alene, slik den ville gjort under vanlig inferens. «Guided reasoning» gir modellen tilgang til fasitsvaret og ber den rekonstruere et plausibelt tankeløp bakover – uten å eksponere svaret direkte i sporet. Et filtreringssteg fjerner tilfeller der fasitsvaret har lekket inn i resonnementet.
Tallene bak påstanden
AWS validerte SDR på tre benchmarks: MedMCQA (medisinske flervalgsspørsmål), CoCoHD (strukturert ekstraksjon fra lange lovtekster) og Invoice-OCR (fakturaanalyse fra skannet bildemateriale). Resultatene er ifølge selskapet konsistente: SDR gir like god eller bedre måldomene-nøyaktighet som standard SFT, mens matematikk-scoren holdes på 65–70 prosent mot basemodelens 70 prosent – mot nær null ved standard SFT uten intervensjon.
Sammenlignet med modellsammenslåing – der finjustert modell og grunnmodell kombineres ved vektet interpolasjon for å gjenvinne tapte evner – viser AWSs data at SDR oppnår nesten identisk matematikk-score (70 mot 68 prosent) samtidig som måldomene-nøyaktigheten er 6,5 prosentpoeng høyere. Tallene er AWSs egne og ikke uavhengig verifisert.
Et ablasjonsstudie på LLaVA-CoT-datasettet viser at SDR er robust også når bare en del av treningsdataene har resonneringsspor. Uten SDR kollapser generell matematikk-evne fra 68 til 3 prosent så snart andelen data med resonneringsspor faller under 25 prosent. Med SDR holder scoren seg på 64–72 prosent uavhengig av andel – også ved null prosent resonneringsdata i treningssettet.
Relevans for domenefinjustering på norsk fagdata
Virksomheter som vurderer finjustering på norsk lovtekst, journaler, finansrapporter eller teknisk dokumentasjon støter typisk på akkurat det problemet SDR adresserer: de har input-output-par, men ikke annoterte tankespor. Manuell annotering av resonneringsspor krever fagekspertise og er sjelden gjennomførbart i stort volum.
SDR er tilgjengelig via Amazon Bedrock og Amazon SageMaker, der Nova 2 Lite allerede støtter SFT. Full finjustering er tilgjengelig via SageMaker, mens Nova Forge – AWSs dypeste tilpasningsverktøy, med prisgang fra rundt 100 000 dollar per år – gir tilgang til full modelltrening på proprietære data. SDR-teknikken er relevant for standard SFT-arbeidsflyter på begge plattformer.
Akademisk forskning støtter den overordnede tilnærmingen: en studie presentert på ACL 2024 viste at selvdistillasjon under finjustering motvirker katastrofisk glemming og opprettholder generell instruksjonsevne i store språkmodeller. AWSs implementasjon for Nova 2 er tilpasset selskapets egne resonneringsmodeller og er ikke direkte sammenlignbar med uavhengige benchmarks.
Neste steg for AWS
AWS presenterer SDR som anbefalt utgangspunkt for SFT-arbeidsflyter der treningsdataene mangler resonneringsspor, men understreker at optimal konfigurasjon avhenger av domene og datasettsammensetning. For oppgaver der korrekthet kan defineres presist – som kodegenerering eller regelbasert klassifisering – peker selskapet mot Reinforcement Fine-Tuning (RFT) som et komplementært alternativ.
AWS har ikke oppgitt tidslinje for ytterligere SDR-oppdateringer eller integrasjon i høynivå-APIer som Bedrock Studio. Kode og eksempler for SDR-pipelinen er tilgjengelig i den publiserte ML-bloggartikkelen, implementert mot Bedrock Converse API med Nova 2 Lite som standardmodell.
De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.
Kilde: https://aws.amazon.com/blogs/machine-learning/exploring-self-distilled-reasoning-for-supervised-fine-tuning-with-amazon-nova/
Bakgrunnskilder: AWS ML-blogg: Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova · ACL 2024: Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning · AWS: Amazon Nova 2 foundation models now available in Amazon Bedrock · WorkOS: Amazon Nova Forge – Custom foundation models are no longer just for tech giants