Ett släpp som är öppet att läsa och stängt att sälja
Alibabas Qwen-team publicerade på söndagen Qwen-Image-2.1, en förenad modell för text-till-bild och bildredigering med 7 miljarder parametrar i den visuella genereringsdelen fördelade på 32 enkelströms diffusionstransformerlager. Vikterna finns på Hugging Face, GitHub och ModelScope, med en demo bredvid.
Villkoren är förändringen. Qwen-Image-2.1 släpps under Qwen Research License Agreement, som bara ger rättigheter för icke-kommersiella ändamål och kräver separat överenskommelse för kommersiell användning. Tidigare Qwen-Image släpptes under Apache 2.0, som inte lägger någon sådan begränsning.
Det är en påtaglig inskränkning inom en och samma familj. Vem som helst kan ladda ner modellen, granska den, finjustera den och skriva om den. En studio som vill lägga resultatet i en kundleverans måste gå och fråga.

Vad modellen gör
Funktionslistan siktar på produktionsarbete snarare än demonstrationer. Qwen-Image-2.1 genererar i bildformat upp till 2048 gånger 2048 bildpunkter, tar emot upp till tio referensbilder samtidigt och producerar RGBA-utdata direkt — genomskinliga lager som kan sättas samman utan ett separat maskeringssteg.
Redigeringen är lokal snarare än helbildsbaserad. En användare kan ringa in ett område, rita på det eller ange en mask, och modellen redigerar innanför den gränsen. Alibaba uppger att modellen bevarar identiteten hos personer och produkter mellan redigeringar, och lyfter fram förbättringar i typografi, porträttljus och fina detaljer. Effektiviseringen ligger i uppmärksamhet med blandad granularitet och återanvänd prefix-KV-cache, varifrån snabbheten på flerbildsindata kommer.
Alibaba uppger att modellen överträffar de flesta system med stängd källkod på den här uppgiften och ändå stannar på 7 miljarder parametrar. Det är bolagets egen beskrivning av sina resultat; någon oberoende utvärdering av Qwen-Image-2.1 finns ännu inte, och modellkortet som publicerades med släppet innehåller inga testresultat.

Varför licensen betyder mer än parameterantalet
Fältet för bildgenerering med öppna vikter har definierats lika mycket av tillåtande licensiering som av förmåga. En modell på 7 miljarder parametrar som kör på ett enda konsumentkort och genererar genomskinliga lager är precis vad små studior och verktygsbyggare tar till sig — och precis vad de inte kan ta till sig under en icke-kommersiell licens.
Den praktiska effekten är att publiken delas. Forskare och entusiaster får modellen på samma villkor som förut. Kommersiella användare slussas in i en förhandling, vilket är poängen med förändringen: den gör en gratis distributionskanal till en säljtratt utan att ge upp anseendevinsten i att publicera vikter.
Att hålla ögonen på
Om nästa Qwen-språkmodeller följer efter. Bildlinjen har på två släpp gått från Apache 2.0 till en forskningslicens; textmodellerna är det mer avgörande fallet, och Alibaba har inte sagt något om att ändra deras villkor. Det andra att följa är hur de kommersiella villkoren faktiskt ser ut när någon får en offert, eftersom forskningslicensen varken anger pris eller process.