AI-billeder og video lokalt i ComfyUI: Hvad kan dit grafikkort, og hvor tæt kommer du på Nano Banana?
Du behøver ikke et RTX 5090 for at komme i gang med lokal billed-AI. Her får du den ærlige guide til VRAM, ComfyUI, åbne billed- og videomodeller samt det, Google stadig gør bedre.
Emma Bergqvist
15 augusti 2026
Du behøver ikke et RTX 5090 for at skabe AI-billeder derhjemme. Men grafikkortet afgør, om oplevelsen føles som et kreativt værktøj eller som at forsøge at få en sofa ind gennem en brevsprække.
Den store skillelinje er VRAM, altså grafikkortets egen arbejdshukommelse. Med 8 GB kan du allerede lave overraskende meget. Med 16 GB bliver langt flere moderne modeller praktisk anvendelige. Ved 24 GB begynder de virkelig store billedmodeller at blive behagelige at arbejde med, mens lokal video stadig kan få selv et dyrt kort til at gispe efter vejret.
Og Nano Banana? Google har nået at gøre navnet til en hel modelfamilie. Lokale modeller kan være konkurrencedygtige i afgrænsede billedopgaver og giver større kontrol over workflowet. Google tilbyder til gengæld en færdig, samtalestyret billededitor med funktioner, som ikke automatisk følger med en lokal model.
Denne guide er opdateret i august 2026.
Først: ComfyUI er værkstedet, ikke selve modellen
ComfyUI er en nodebaseret brugerflade til generativ AI. Du bygger et workflow ved at forbinde noder til model, prompt, sampling, billedstørrelse, referencebilleder, opskalering og lagring.
Det lyder mere besværligt end et tekstfelt med en stor knap. Det er det også, i hvert fald den første aften. Belønningen er, at du kan se, gemme og ændre hvert trin i processen. Det samme workflow kan køres igen med et nyt motiv, en anden model eller hundrede variationer, uden at du skal begynde forfra.
Derfor er ComfyUI blevet populært blandt folk, der vil have mere end et hurtigt billede:
workflows kan gemmes og deles
modeller kan kombineres med LoRA-tilføjelser, små modelpakker til en bestemt stil eller et bestemt motiv, og ControlNet til styring med for eksempel positurer, kanter eller dybde
referencebilleder og masker kan styres på detaljeniveau
billedserier kan sættes i kø og automatiseres
materialet kan behandles lokalt, når modellerne er downloadet
ComfyUI's aktuelle systemkrav angiver understøttelse af Windows, Linux og macOS samt NVIDIA, AMD, Intel og Apple Silicon. Det betyder ikke, at alle kombinationer er lige nemme. Portable-versionen til Windows understøtter NVIDIA eller CPU-tilstand, mens AMD og Intel bruger andre installationsmetoder.
VRAM er dørmanden
Et AI-workflow bruger flere dele på samme tid: modelvægte, en tekstencoder, der fortolker prompten, en VAE, som omkoder billeder til og fra modellens arbejdsformat, samt midlertidige data fra selve genereringen. Det hele vil helst ligge i VRAM, fordi grafikkortet kan tilgå sin egen hukommelse langt hurtigere end computerens almindelige RAM.
Når det hele ikke kan være der, kan ComfyUI flytte dele til systemhukommelsen. Det kaldes offloading. Workflowet kan så stadig fungere, men hver flytning koster tid. Har du for lidt RAM eller langsom lagring, bliver ventetiden endnu mere mærkbar.
Derfor kan to personer med 16 GB VRAM få helt forskellige resultater. Modelversion, præcision, opløsning, antal billeder, tekstencoder og workflow betyder mindst lige så meget som tallet på æsken.
Hvad betyder FP16, FP8 og FP4?
Modeller gemmer deres tal med forskellig præcision. Lavere præcision reducerer filstørrelse og hukommelsesbehov, men kan påvirke kvalitet, kompatibilitet eller hastighed afhængigt af hardwaren.
BF16 og FP16: tunge, men almindelige formater med høj præcision
FP8: omtrent halvdelen af størrelsen på modelvægtene sammenlignet med 16-bit-formater, før de øvrige dele regnes med
FP4: endnu mindre, men understøttelsen og kvalitetstabet varierer mere
GGUF: et format til kvantiserede modelvægte, som ofte bruges i brugerskabte workflows
Kvantisering er ikke gratis magi. En model, der kan starte på 8 GB, er ikke automatisk hurtig der, og en brugerskabt konvertering er ikke automatisk lige så god som originalen. Se det som en måde at åbne døren på, ikke som en garanti for den samme oplevelse.
Hvad kan du i praksis med 8, 12, 16, 24 og 32 GB?
Følgende er praktiske udgangspunkter, ikke løfter om kompatibilitet. Det præcise behov afhænger af modelversion, præcision, opløsning, batchstørrelse, antal frames, tekstencoder, VAE og offloading. ComfyUI udvikler sig desuden hurtigt, så en ny kvantisering eller et smartere workflow kan flytte grænsen.
8 GB: Du kan komme i gang, men vælg modellen før opløsningen
Med 8 GB VRAM er ældre og mindre billedmodeller stadig anvendelige. SDXL kan køres i hukommelsestilpassede workflows, og kvantiserede moderne modeller kan fungere, hvis du accepterer offloading og længere ventetid.
Video er ikke længere helt udelukket. ComfyUI's officielle workflow til Wan 2.2 TI2V 5B oplyser, at 5B-versionen bør kunne rummes fint i 8 GB VRAM med ComfyUI's indbyggede offloading. Det er en vigtig milepæl, men det betyder ikke, at tung lokal video pludselig er blevet hurtig på et grafikkort i den billige ende.
En god strategi med 8 GB:
begynd med modellens officielle skabelon, og sænk opløsningen, hvis du får en hukommelsesfejl
generér ét billede ad gangen
vælg officielle workflows med FP8 eller andre hukommelsesbesparende alternativer
luk spil og GPU-tunge programmer, før du går i gang
sørg for rigeligt med almindelig RAM til offloading
10 til 12 GB: En god billedmaskine med tydelige grænser
Her bliver SDXL mere behagelig at arbejde med, og flere kvantiserede workflows bliver praktisk anvendelige. Et RTX 5070 har 12 GB, og Intel Arc B580 har også 12 GB ifølge henholdsvis NVIDIAs og Intels specifikationer.
Det er et fornuftigt niveau, hvis du primært vil skabe billeder og kan leve med, at de største modeller bruger offloading. Til video er korte klip med mindre modeller mulige, men LTX-2.5 og de store Wan-varianter er stadig tunge på 12 GB.
16 GB: Det bedste balancepunkt for mange
16 GB giver mere luft til større billeder, ControlNet, flere referencer og moderne kvantiserede modeller. RTX 5070 Ti og RTX 5080 har 16 GB, ligesom Radeon RX 9070 og RX 9070 XT ifølge producenternes specifikationer.
Et konkret eksempel er Z-Image-Turbo. Modelkortet beskriver den som en billedmodel med 6 milliarder parametre, der er destilleret til otte modelevalueringer (8 NFEs) og kan rummes i 16 GB VRAM. Den er udgivet under Apache 2.0-licensen og er derfor et interessant førstevalg til lokal billedgenerering, hvor både kvalitet og almindelig forbrugerhardware betyder noget.
16 GB er dog ikke en fribillet til alt. FLUX.2 Klein 4B er et relevant eksempel: Black Forest Labs angiver omkring 13 GB VRAM og har udgivet 4B-varianten under Apache 2.0-licensen. Qwen-Image og FLUX.2 Dev er betydeligt større. De kan køres med kvantisering og offloading, men workflowet bliver tungere og langsommere, end en enkel VRAM-tabel antyder.
24 GB: Store billedmodeller bliver en realistisk mulighed
Med 24 GB kan du arbejde langt mere ubesværet med tunge billedmodeller og flere komponenter på samme tid. Det er en væsentlig grund til, at brugte RTX 3090-kort stadig er interessante til lokal AI, selv om de ikke er nye.
ComfyUI's officielle referencetest af den oprindelige Qwen-Image-model i FP8, ikke Qwen-Image-2512, brugte et RTX 4090D med 24 GB. Workflowet brugte omkring 86 procent af kortets VRAM. Det første billede tog cirka 94 sekunder og det næste cirka 71 sekunder i netop det testmiljø. Det er nyttige referenceværdier, men ikke universelle benchmarks. Din opløsning, driver og dit workflow kan give helt andre tider.
Qwen-Image-2512 er især interessant til realisme, detaljer og tekst i billeder. Udviklerens modelkort beskriver forbedringer i gengivelsen af mennesker, naturdetaljer og typografi sammenlignet med den første Qwen-Image-version. Modellen er licenseret under Apache 2.0, men selve modelpakken og tekstencoderen er store.
32 GB og mere: Mindre offloading, ikke ubegrænset kraft
RTX 5090 har 32 GB VRAM. Det gør en enorm forskel for store billedworkflows og reducerer behovet for at flytte data over i RAM. Men selv 32 GB kan være for lidt til de tungeste originale modelvægte.
FLUX.2 Dev har 32 milliarder parametre, og den officielle ComfyUI-guide bruger kvantiserede vægte. Black Forest Labs' aktuelle hurtigguide angiver omkring 24 GB for Klein 9B og 13 GB for Klein 4B, men hukommelsesbehovet varierer med pakning og workflow. Pointen er enkel: Topkort betyder færre kompromiser, ikke at hukommelsesregnestykket forsvinder.
Til lokal video kan 32 GB gøre flere workflows realistiske, men ikke problemfrie. Den aktuelle LTX-2.5-familie viser hvorfor: Lightricks' standardpakke fylder omkring 66 GiB, når transformermodel, tekstencoder, video-VAE, audio-VAE og opskaleringsmodel regnes sammen. Kvantisering og offloading kan derfor være nødvendige selv på kort med 24 eller 32 GB.
Hvilken billedmodel skal du begynde med?
Der findes ingen model, der vinder alt. Vælg efter den opgave, du faktisk vil løse.
Z-Image-Turbo: En hurtig vej ind på 16 GB
Z-Image-Turbo er et godt udgangspunkt til fotorealistiske motiver, engelsk og kinesisk tekst samt hurtig iteration. Den er destilleret til otte modelevalueringer, mens udviklerens kodeeksempel bruger ni inferenstrin. Modelkortet angiver, at den uden problemer kan rummes på forbrugerkort med 16 GB VRAM.
Forbeholdet er, at Turbo er destilleret. Den prioriterer hastighed og har mindre variation end den fulde Z-Image-model. Hvis du vil finjustere modellen eller have større kreativ kontrol, kan grundmodellen være mere interessant.
Qwen-Image-2512: Stærk til tekst og detaljer
Qwen-Image er tung, men attraktiv, når tekst i billedet, komplekst layout eller realistiske detaljer er i centrum. Apache 2.0-licensen gør også vilkårene nemmere at vurdere i forbindelse med kommercielle projekter end vilkårene for modeller med egne, begrænsende licenser.
På mindre kort bør du regne med kvantisering og offloading. På 24 GB findes der en officiel ComfyUI-referenceværdi, men ikke et løfte om, at ethvert Qwen-workflow kan rummes i hukommelsen.
FLUX: Læs efternavnet og licensen
FLUX er en familie, ikke én enkelt model. FLUX.1 Schnell og FLUX.2 Klein 4B bruger Apache 2.0. Modellerne FLUX.1 Dev, Krea Dev, Kontext Dev, FLUX.2 Dev og Klein 9B må ifølge standardlicenserne kun køres til ikke-kommercielle formål og må ikke bruges i produktion. Kommerciel drift på egen hardware kræver en separat licens fra Black Forest Labs. Genererede resultater må samtidig anvendes kommercielt i henhold til licensernes øvrige vilkår.
Det er et perfekt eksempel på, hvorfor åbne modelvægte, ofte kaldet open weights, ikke altid betyder "gør, hvad du vil". Læs modelkortet for den præcise modelversion, før du bygger et kundeprojekt omkring den.
SDXL: Stadig relevant
SDXL er ikke den nyeste model, men økosystemet er modent. Der findes masser af LoRA-tilføjelser, ControlNet-varianter og dokumenterede workflows. Hvis du vil lære ComfyUI på et kort med 8 til 12 GB, kan et hukommelsestilpasset SDXL-workflow være mere lærerigt end at begynde med årets største model og derefter bruge hele aftenen på at fejlfinde hukommelsesfejl.
Lokal video i 2026: Muligt med 8 GB, men sjældent bekvemt
Billedgenerering og videogenerering bør ikke slås sammen. Et stillbillede er én frame. Et videoklip skal holde motiv, bevægelse, kamera og detaljer sammen gennem mange frames. Det koster hukommelse, tid og lagerplads.
Wan 2.2 er det fornuftige udgangspunkt
Wan 2.2 findes i flere størrelser. Den mindre TI2V-5B kan både lave tekst-til-video og billede-til-video og er den model, som ComfyUI oplyser bør kunne rummes fint i 8 GB VRAM med offloading. De større 14B-varianter er bygget til tungere tekst- eller billedstyret video og kræver mere tålmodighed og hukommelse.
Wan 2.2-modellerne i ComfyUI's guide angives at være licenseret under Apache 2.0. Det er usædvanligt let at forstå sammenlignet med flere andre videogeneratorers speciallicenser.
LTX-2.5 kan skabe lyd og video sammen
LTX-2 findes i flere generationer. ComfyUI's LTX-2.0-workflow bruger den ældre 19B-model og kan generere synkroniseret video og lyd. Den aktuelle LTX-2.5-familie er 22B. ComfyUI har indbyggede workflows til tekst-til-video, billede-til-video samt styring med første og sidste frame.
Det er imponerende, men filstørrelserne afslører hardwarekravet. Standardpakken til LTX-2.5 fylder omkring 66 GiB og er betydeligt tungere end den ældre 19B-version. Offloading til RAM eller disk og FP8-kvantisering kan hjælpe, men de fjerner ikke al ventetiden.
LTX-2.x Community License blev ændret den 11. august 2026 og indeholder en omsætningstærskel, som betyder, at større kommercielle organisationer skal have en betalt licens. Det er endnu en grund til at kontrollere vilkårene for den præcise modelversion, før modellen bruges i en virksomhed.
Sammenlign video med Gemini Omni Flash og Veo, ikke Nano Banana
Nano Banana er Googles familie til billeder. Googles aktuelle standardmodel til korte videoklip er Gemini Omni Flash Preview. Modellen skaber 3 til 10 sekunders video i 720p med lyd og kan redigeres videre gennem flere samtalerunder.
Veo 3.1 Preview er stadig relevant, når du har brug for højere opløsning eller særlige filmiske styringsmuligheder. Dokumentationen til Gemini API angiver indbygget lyd, referencebilleder samt styring med første og sidste frame. 4K findes i Veo 3.1 og 3.1 Fast til klip på 8 sekunder, mens Lite højst når 1080p.
Lokale Wan- og LTX-workflows giver dig mulighed for selv at lagre materialet og bevare en høj grad af kontrol. Googles modeller giver dig et færdigt, stærkt system, uden at dit eget grafikkort skal gøre arbejdet. Det er to forskellige kompromiser, ikke det samme produkt med et andet logo.
Hvor tæt kommer de lokale modeller på Nano Banana 2?
Google bruger nu Nano Banana som fællesnavn for fire billedmodeller:
Nano Banana 2 Lite: den hurtigste og billigste variant
Nano Banana 2: allroundmodellen med 4K, flere referencebilleder og tekst
Nano Banana Pro: premiumvarianten til komplekst layout, brandkontrol og avanceret redigering
Nano Banana: den ældre Gemini 2.5 Flash Image-model
Ifølge Google får alle genererede billeder et usynligt SynthID-vandmærke. Nano Banana 2 og Pro kombinerer desuden billedgenerering med Geminis sprogforståelse og kan hente aktuelle oplysninger fra Google Search som grundlag. Det kan en ren lokal billedmodel ikke gøre af sig selv.
Her er de lokale modeller tæt på
Til enkelte tekst-til-billede-opgaver kan Z-Image-Turbo, Qwen-Image-2512 og navngivne FLUX-varianter være konkurrencedygtige. Modeludviklernes egne test viser, at flere af dem klarer sig godt mod lukkede tjenester i bestemte testsæt.
Men vær skeptisk over for ranglisterne. Forskellige testsæt, menneskelige bedømmere, prompts og modelversioner gør hurtigt "bedst" til et markedsføringsord. Der findes ingen aktuel, uafhængig og fuldt sammenlignelig måling, som beviser, at en lokal model generelt matcher hele Nano Banana 2-familien.
Her har Google stadig en tydelig fordel
Nano Banana er mere end en billedgenerator. Du kan føre en dialog, tilføje flere referencebilleder, bede modellen om at forsøge at bevare en person eller et produkt og derefter ændre dele af scenen i flere trin. Google forbinder billedmodellerne med bred viden og kan hente aktuelle oplysninger fra Google Search i Nano Banana 2 og Pro.
Lokalt kan du bygge tilsvarende dele med Qwen-Image-Edit-2511, ControlNet, IP-Adapter, masker, LoRA og dine egne noder. Resultatet kan blive mere kontrollerbart, men du skal selv vælge og forbinde værktøjerne. Google sælger en færdig værkfører. ComfyUI giver dig hele værktøjsvæggen og lader dig selv læse manualerne.
Her vinder den lokale løsning faktisk
Lokal generering har tre fordele, som en cloudtjeneste har svært ved at kopiere:
Kontrol: Du kan gemme seed, samplingmetode, modelversion og hele workflowet for at genskabe kørslen, så langt det er muligt i det samme software- og hardwaremiljø.
Privatliv: Efter download kan et rent lokalt workflow køres, uden at dine arbejdsbilleder sendes til en ekstern billedtjeneste.
Tilpasning: Du kan bruge dine egne LoRA-tilføjelser, ControlNet, batchkørsler og modeller uden at vente på, at en leverandør bygger funktionen.
Privatliv kræver stadig sund fornuft. Tilpassede noder, ofte kaldet custom nodes, er kode fra tredjeparter og kan have netværksfunktioner. Undersøg, hvad du installerer, ligesom du ville gøre med andre programmer.
NVIDIA, AMD eller Intel?
NVIDIA: Det nemmeste valg til flest workflows
Min vurdering er, at NVIDIA stadig er det nemmeste valg, hvis du vil minimere installationsarbejdet. Portable-versionen af ComfyUI til Windows er bygget til NVIDIA-kort eller CPU-tilstand, mens AMD og Intel bruger andre installationsmetoder.
Det betyder ikke, at ethvert NVIDIA-kort er bedre end alle alternativer. Til lokal AI kan et ældre kort med 24 GB være mere anvendeligt end et nyere og hurtigere kort med 8 eller 12 GB, netop fordi VRAM afgør, hvor meget af et workflow der kan være på grafikkortet.
AMD: Bedre officiel understøttelse, men stadig situationsafhængig
ComfyUI fik officiel understøttelse af ROCm, AMD's platform til GPU-beregninger, i Windows i version 0.7.0. ComfyUI's aktuelle systemkrav beskriver understøttelsen af AMD RDNA 3, 3.5 og 4 i Windows og Linux som eksperimentel. Til AMD på Linux findes ROCm 7.2 både som stabil version og som en dagligt opdateret testversion.
AMD's aktuelle GPU-tabel angiver 16 GB til Radeon RX 9070 og 9070 XT samt 24 GB til RX 7900 XTX. Det er attraktive hukommelsesniveauer. Kontrollér alligevel, at netop den model, de noder og den præcision, du vil bruge, fungerer med ROCm, før du køber et kort udelukkende til AI.
Intel: Muligt, men vælg det ikke i blinde
ComfyUI understøtter Intel Arc gennem PyTorchs XPU-understøttelse til Intel-grafik. Arc B580 har 12 GB VRAM, hvilket giver plads til mindre workflows og workflows med offloading. Kontrollér alligevel understøttelsen af hver model og hver tilpasset node separat.
Har du allerede et Arc-kort, er det værd at prøve. Køber du et kort udelukkende til ComfyUI, bør du først kontrollere installationen og de tilpassede noder, som indgår i de workflows, du vil bruge.
Sådan kommer du i gang uden at sidde fast i installationssumpen
Kontrollér VRAM og RAM. I Windows kan du se GPU-hukommelsen i Jobliste. Sørg også for, at du har rigeligt med almindelig RAM, hvis offloading bliver en stor del af planen.
Vælg den rigtige installation. ComfyUI Desktop er nemmest på understøttet hardware. Portable er beregnet til NVIDIA-kort på Windows. Manuel installation dækker flest platforme.
Opdatér ComfyUI. Nye officielle workflows kan mangle i Desktop, indtil de har nået en stabil version.
Begynd med en skabelon. Vælg en officiel modelskabelon i workflowbiblioteket i stedet for en tilfældig pakke med tyve tilpassede noder.
Ændr én ting ad gangen. Kør standardworkflowet først. Hæv derefter opløsning, batchstørrelse eller antal frames, ikke det hele på én gang.
Læs modellicensen. Licensen til ComfyUI fortæller ikke, hvad du må gøre med hver enkelt model eller modelversion.
Hvis du får CUDA out of memory eller en tilsvarende fejl, er den første løsning ikke at købe et nyt kort. Sænk opløsningen eller antallet af frames, vælg en mindre eller kvantiseret model, og kontrollér, at ComfyUI faktisk bruger offloading.
Den ærlige købsanbefaling
Køb ikke et grafikkort ud fra navnet på den model, du så i en demo. Begynd med dit workflow.
Nysgerrig nybegynder, primært interesseret i billeder: 8 til 12 GB er nok til at komme i gang med mindre workflows eller workflows med offloading.
Moderne billeder, redigering og færre kompromiser: 16 GB er et stærkt praktisk niveau.
Tunge billedmodeller og lokal AI som hovedinteresse: 24 GB er stadig meget attraktivt.
Tunge lokale videomodeller: 32 GB hjælper, men regn stadig med store filer, lang ventetid og speciallicenser.
Nano Banana 2 kræver mindre forberedelse, når du vil skrive en instruktion og redigere videre med det samme. ComfyUI giver dig i stedet kontrol over processen og gemte indstillinger, og du bestemmer præcis, hvilke værktøjer der bruges.
For mange er den bedste løsning faktisk begge dele. Brug cloudtjenesten, når dens multimodale intelligens sparer tid. Kør lokalt, når du prioriterer kontrol, privatliv, eksperimenter eller mange iterationer.
Når du sammenligner brugte grafikkort på TechFlip, skal du ikke kun se på spilydelsen. Til lokal AI kan mængden af VRAM være vigtigere end, om kortet tilhører den nyeste generation.
– Emma Bergqvist
Kilder og videre læsning
Denne artikel er oversat fra den svenske original ved hjælp af AI. Indholdet er det samme – men enkelte oversættelsesfejl kan forekomme.