AI-laber og teknologiselskaperPublisert 19. juli 2026
NVIDIA og Hugging Face integrerer NeMo Automodel med Diffusers for distribuert videotrening
Seks modeller støttes fra dag én — inkludert FLUX, Wan og HunyuanVideo — uten konvertering av modellvekter. Wan 2.1 på 1,3 milliarder parametere kjører på én enkelt 40 GB A100.
NVIDIA og Hugging Face har integrert NeMo Automodel med Hugging Face Diffusers slik at utviklere kan finjustere video- og bildemodeller i industriskala uten å konvertere modellformater eller skrive om kode. Integrasjonen er tilgjengelig nå under Apache 2.0-lisensen.
NVIDIA og Hugging Face kunngjorde torsdag en integrasjon mellom NeMo Automodel — NVIDIAs åpne treningsbibliotek — og Hugging Face Diffusers, den mest brukte plattformen for diffusjonsmodeller innen bilde- og videogenerering. Enhver modell i Diffusers-format på Hugging Face Hub kan nå finjusteres med distribuert, produksjonsklar trening uten å konvertere vektfiler til et eget format.
Et utviklerteam som vil tilpasse FLUX.1-dev (12 milliarder parametere) til en spesifikk visuell stil, kan hente modellen direkte fra Hub, trene og lagre resultatet tilbake — og bruke verktøy som kvantisering, kompilering og LoRA-adaptere uten ekstra tilpasningsarbeid. Nye modeller skal kunne legges til uten kodereskriving, ifølge selskapene.
Seks modeller klare fra dag én
Integrasjonen leveres med ferdige finjusteringsoppskrifter for seks modeller: Wan 2.1 T2V i variantene 1,3 og 14 milliarder parametere, Wan 2.2 T2V A14B (27 milliarder parametere totalt, 14 milliarder aktive per steg via MoE-arkitektur), FLUX.1-dev, FLUX.2-dev (32 milliarder parametere), HunyuanVideo 1.5 og Qwen-Image på 20 milliarder parametere.
Wan 2.1 med 1,3 milliarder parametere er den eneste modellen som passer på ett enkelt 40 GB A100-grafikkort — alle øvrige krever flere GPU-er. LoRA-støtte følger med for fire av de seks modellene; Wan 2.2 og Wan 2.1 14B mangler LoRA-oppskrift per i dag, ifølge integrasjonsdokumentasjonen.
Parallellisme som konfigurasjon
Kjernen i NeMo Automodel er at parallellisering styres via konfigurasjonsfiler i YAML-format, ikke via kodeendringer. Biblioteket støtter FSDP2, tensor-, kontekst- og pipeline-parallellisme. Brukeren bytter mellom dem ved å endre én konfigurasjonslinje.
For orkestrering av treningsjobber på flere maskiner støttes SLURM; Kubernetes-støtte er oppgitt som kommende. Verktøysettet er åpent tilgjengelig på GitHub under Apache 2.0-lisensen.
NVIDIAs egne ytelsesmålinger viser at full finjustering av FLUX.1-dev på åtte H100-kort (80 GB HBM3, fullt NVLink-koblet) gir en stegstid på 0,902 sekunder og en gjennomstrøm på 35,51 bilder per sekund. LoRA-finjustering av samme modell produserer 53,73 bilder per sekund. Tallene er ikke uavhengig verifisert.
Slik fungerer arbeidsflyten
Blogginnlegget publisert av NVIDIA og Hugging Face 17. juli 2026 illustrerer flyten med finjustering av FLUX.1-dev på et datasett med 78 Rider-Waite-tarotkort. Første steg er forbehandling der bildedata kodes til VAE-latenter og tekstinnbygginger og lagres i et mellomlager — én gang, slik at treningsløkken slipper å gjenta beregningen.
Treningen startes med en eksisterende YAML-fil og kommandolinje-overrides for datasett og antall steg. Etter 200 optimeringssteg reproduserte eksempelkjøringen den karakteristiske stilen fra tarotdatasettet når et triggernøkkelord ble brukt i prompten, mens grunnmodellens generelle evner forble intakt uten triggeren.
Relevans for norske AI-miljøer
For norske teknologiselskaper og forskningsinstitusjoner som arbeider med visuelle AI-modeller, senker integrasjonen den tekniske terskelen for distribuert trening. Tidligere krevde produksjonsklar finjustering av store diffusjonsmodeller enten dyp kompetanse på parallell treningsinfrastruktur eller proprietære skybaserte løsninger.
Virksomheter underlagt EUs AI-forordning — som er under EØS-behandling og dermed relevant for norsk rett — bør merke seg at åpen kildekode ikke fritar fra krav om dokumentasjon og risikovurdering i regulerte applikasjoner. Apache 2.0-lisensen gir fri tilgang til kildekoden, men sier ingenting om regulatorisk samsvar.
Hugging Face Hub er per 2026 verdens største åpne depot for AI-modeller med over 900 000 modeller tilgjengelig, ifølge bransjekilder, noe som i prinsippet gjør treningsoppskriftene anvendbare på et bredt spekter av fremtidige diffusjonsmodeller uten infrastrukturombygging.
Python-API under utvikling
YAML-basert konfigurasjon dekker behovet for reproduserbare eksperimenter i team som versjonskontrollerer konfigurasjonsfiler. En kommende versjon av NeMo Automodel vil eksponere de samme oppskriftene gjennom et fullt typet Python-API, noe som skal gjøre det enklere å integrere biblioteket i eksisterende treningskode, Jupyter-notebooks og eksperimentrammeverk.
Ingen dato er satt for lanseringen. Dokumentasjon for den eksisterende integrasjonen er publisert i Diffusers treningsveiledning og NeMo Automodel-dokumentasjonen.
De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.
Kilde: https://huggingface.co/blog/nvidia/scale-diffusers-finetuning-nemo-automodel
Bakgrunnskilder: NVIDIA NeMo Automodel — GitHub · NeMo Automodel — offisiell dokumentasjon · Hugging Face Diffusers — GitHub · Hugging Face Enterprise Guide 2026 — Hyperion Consulting