2026年10月6日火曜日

Qwen image 2.1

最新のstable-diffusion.cppはまだいらないかな?とか思っていたのですが、どうやら2週間ほど前にタイトルのQwen Image 2.1がリリースされていたみたいですね。

で、stable-diffusion.cppのリリースを見ると

2026/09/20 🚀 stable-diffusion.cpp adds Day-0 support for Qwen-Image-2.1 

とのこと。さすがの対応の早さです。が、syclで動かせない気配がプンプンするんだよなぁ…

とりあえず、別のディレクトリにgit pullしてbuild-sycl内にそのままビルドして…途中でフリーズするかもしれないけど、今までの実行した履歴メモからいくつか試してみると、

[WARN   ] model_manager.cpp:1753 - model manager memory on SYCL0: reported free 298.61 MB / total 12486.72 MB, tracked weights 0.00 MB / other runtime 0.00 MB / current runtime 0.00 MB
[WARN   ] model_manager.cpp:1919 - model manager cannot make enough memory available on SYCL0: need 1552.13 MB device / 1040.13 MB budget, available 298.61 MB device / 4090.26 MB budget
[ERROR  ] ggml_runner.cpp:899  - z_image segment 1/36 (z_image.prelude) failed during weight preparation
[ERROR  ] diffusion_engine.cpp:2594 - diffusion model compute failed
[ERROR  ] diffusion_engine.cpp:2733 - Diffusion model sampling failed
[ERROR  ] image.cpp:907  - sampling for image 1/1 failed after 0.04s
[ERROR  ] main.cpp:928  - generate failed

と警告から始まって、エラーで終わる状態に。確保しようとしているメモリーのサイズが巨大になってるのと、なんか辻褄があってなさそうなのやら…良く分からないですが。

とりあえずz-imageの別の量子化モデルを使用してみたり、テキストエンコーダもいいさなモデルを利用したり、画像サイズも256x256とか小さくしてみたり、cpu実行にさせてみたり試してみましたが、syclベースでは実行することはできませんでした。違うエラーは出たのですが、結局セグメントフォルトなのでメモリー不足によるエラー。

いろんな意味で最小のサイズで実行しても実行できそうにないので、一旦syclはあきらめ、CPU版のビルドを行って実行してみました。

とりあえず、先ほど何個か実行したものを実行したところ、綺麗に出力が行われました。実行時間は…すごいことになりますが(笑)

過去に実行したままのプロンプトなので、ほぼ同じ画像が作成されることも確認。かなりCPUと一致した状態だったのですが、最新のmasterをpullしたstable-diffusion.cppでは若干差異が出ていました。原因がstable-diffusion.cppなのか、ggmlなのかは不明ですが、ほぼ一致しているので、この際細かいことは置いておきましょうかね(笑)

そういえば、stable-diffusion.cppはnative指定は追加してるけど、なんちゃってavx512とか指定したことないから、追加してあげればCPUの実行時間が若干短くなるかな?焼け石に水っぽい感じもしますけど…(途中でビルドしてみましたが、378.53s/it -> 366.39s/it と1step当り12s程度早くなりました。20stepsなので、合計で200sec程度…トータルで7781.59s -> 7452.02s と早くはなってますが、分母が130分なので誤差ですw)

とりあえずそのまま長時間の実行をして、何枚かサンプルっぽい画像を作成しました。

stable-diffusion.cppのサンプルでは猫がサインボードを持っている画像に対抗して「犬」にしているわけですが…

良い感じで出力されました。量子化はQ4ですが、問題なさげです。

結局LLMの中身は同じで蒸留しているだけというお墨付きをもらってるようなので、日本語も試してみます。

Ovisで試した感じの物です。

最近は涼しくなってますけど、ちゃんとした日本語が出てきました。しかもモノすっごい日本人っぽい感じがします(笑)

で、なんとなく先日からおもむろに「ふつつかな悪女」と入力してどんなものが出力されるのか試してたりします… 

イラスト風な感じが強いですがこんな感じになりました。ちなみにz-imageだとヤンキーな感じでしたw

そしていつもの…

金魚とかコイっぽい感じの物が出てきました。いすぎな気がしますがw

Qwen Image特有のディザグラデーションっぽい表現ではなくなっていますけど、2.1と言っても今までのベースとなっているものは変わってないのかなぁという感じがします。 

0 件のコメント:

コメントを投稿