現状使えそうなモデルはあまりないのですが、ここ最近生成された画像から写真っぽい画像をGemma4 E4B it UD_Q8_0とQwen3.6 35B A3B UD_Q2_K_XLのモデルでどちらも若干ハンデがある感じになっているのですが…そこはいまストレージに入ってるモデルを減らしているのですみません…w mmprojはどちらもBF16のモデルを使用しました。
2026年5月10日日曜日
llama-cppが新しくなったので、少しチャットして様子を見てみた。
SYCLの動きが少しまともになってるかどうか確認するために少し動かしてみました。
起動直後、数回空振りした感じもありましたが、モデルのロードが終わって動きだしてしまえばすこし文字の出力がスムーズになったような気がします。(という思い込みで見ているので変わってないかもしれないw)
LocalAI内で無視されてるかもしれないが、GPUのレイヤーを9999とかに設定しても落ちなくなりました。
で、今回は少し前に気になっていたGemma4の調整済みのit版ではなく素のモデルとチャットしてみました。
モデルはGemma4E4Bのit版とは違ってこちらはLLMを使用する上で必要となる調整が行われていないモデルなので、調整で使用したテンプレートなどもなく、最低限の物だけとなります。
適当に設定して動かしてみると、とりあえず会話はできましたが、本当に会話ができるレベルでした。
とりあえず、いつも通り挨拶して、自身の説明をお願いすると、なんとChatGPT3.5Turboと言い出しました…。この辺はベースとなるモデルという事なのか、生成AIの定義の知識の断片なのかは判断できませんでしたが、そういう感じなのでしょう(笑)
その後も何度か自身の説明を求めましたがここまで具体的な回答は得られなかったので、学習内容の断片なのかな。
すでに会話の中で少し矛盾もチラホラ見えているので、調整が行われていないモデルはこんな程度なのかな?まぁ量子化モデルなのも影響しているとは思いますが。普通に考えると、得られたトークンからその先のトークンを補完するという生成AIの純粋な出力なのかもしれません。
システムプロンプトを設定すると反映されているものの、it版とは違って人格のようなものが全くない状態で本当にデータを検索している感じが強く感じることができます。下地はしっかりしていて、チャットは行えるのでもう少し時間を取って調べてみたいと思いました。
2026年4月10日金曜日
llama.cpp on ubuntu あれ?もしかしてvulkan?
今の今までllamaでintelならoneAPIでしょ?って思って疑わなかったんですが…もしかして正式にはvulkanじゃないとダメなのかなw
リリースの一覧を見ていると…Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu x64 (ROCm 7.2) Ubuntu x64 (OpenVINO)あれ?さらに下を見ると…Windows x64 (Vulkan) Windows x64 (SYCL) Windows x64 (HIP)…SYCLってWindowsしかないんじゃ…(汗
llama.cpp: Gemma 4 26B A4B 量子化されたモデルの動作メモリ
妙に使用メモリが少ないと思ったんですよ(笑)
あと、今までも妙なメモリの変動があったのはあったんですが、A4BのモデルではCPUのみとは言え、メインメモリーには展開されるはずなので…
で、不思議なのはまともに会話が成立していた点はちょっと恐ろしくもあります。
2026年4月8日水曜日
gemma-4-26b-a4b-it-UD-Q の動作
今まで動かしたモデルの最大パラメータ数はgemma-3-12b-Q4_K_M.gguf(ファイルサイズ約7.3GB)で、このモデルを実行すると確実に動作が極端に落ちたので量子化されたモデルでも実際によく試すものは4Bクラスのものが中心となっていました。
gemma 4のこのA4Bだとファイルキャッシュを含めてメモリーに格納できれば動作はそこまで極端に落ちない感じです。ほぼほぼCPUのみの動作に近い環境ですが。
なぜほぼCPU環境なのかと言えば、SYCLで動かしているとgpu_layers: 1より増やすと機動的無くなってしまうので…原因は単にGPUメモリの確保が足りないか、バグなのかはわかりません。
2026年4月7日火曜日
Gemma 4 26B A4B 例のフィルター
実際問題あまり問題ない倫理フィルターですが、動作確認的にどの程度で引っかかってくるのか気にはなります。E2BとE4Bの引っかかり具合の差は明らかにE4Bの方が厳しくなっていたのですが、それが大きいパラメータを背負っているモデルではどのように変わるのでしょうか?
2026年4月6日月曜日
Gemma 4 26B A4Bの画像認識について
最初に断わっておくと、E2BやE4Bはお笑いレベルでしたが、26B A4Bは道具レベルになっています。
E2B / E4Bモデルの量子化モデルを使って画像からの文字認識率を比較してベースのパラメータサイズがかなり影響を受けていることを感じていました。26B A4Bの量子化がかなりかかったモデルも動かせたので早速確認することにしました。
…Gemma 4 26B A4Bの量子化版UD-Q2_K_XLが普通に使えて驚いた…
つい魔が差して手を出してしまいました。
ほら、やっぱりアクティブトークンが4Bレベルで動作するとか気になるじゃないですか?
2B、4B、26Bとかのボリューム感
実際に生成AIに直接触れ始めたのは去年のGemma 3ぐらいからですが、どうもパラメータ数を表す単位が大きすぎて想像が全くつかなかったので、身近な(?)数字で感覚的にとらえられないかと考えていました。
Gemma 4 E2BのQ8_0とかの画像認識
今までは「ギリ動かせる」モデルとしてE4Bベースのモデルを動かしていましたが、身の丈に合った小さいモデルがどの程度の実力なのか気になったので少し確認してみました。
実際に動かしてみると、ザックリと触れる分にはE4BもE2Bも大差がないのかもしれません。
2026年4月5日日曜日
Gemma 4 update(多分正式リリースアナウンス版が反映されている感じ)
google/gemma-4-E4B 3日前にアップデートされunslothさんのものも昨日アップデートされていました。
Gemma 4 で(思考抑止で)くだらないチャットを続けてました。
Local AIでgguf内で定義されているトークナイザ用のテンプレートを利用した場合にシステムプロンプトがちゃんと扱われているかRakuten AI 2.0miniの時には半信半疑だったのですが、ちゃんと機能しているようです。
llama.cpp LOGIT_SOFTCAPPINGがどうたらこうたら
Gemma 4関連でllama.cppのアップデートが行われていないかチェックしているのですが、にわかな私ですら結構インパクトのありそうな修正が入ってるような気がします。
2026年4月4日土曜日
Gemma 4 (思考抑止モード)がどの程度遊びに付き合ってくれるか試してみた(笑)
Gemma 4の画像認識がどの程度なのかを見ていてどの程度のものが倫理フィルターに引っかかってしまうのか気になったので試してみました。
Gemma 4 (主にE4B) の画像認識
まだ突っ込んだチャットはしていないのですが、mmprojが目についたのでvision機能について少し遊んでみました。(Unslothさんはほぼフルセットのggufが作成されているので私のようなにわかにとても助かります。ドキュメントも整備されていてものすごく理解が早まります。)
比較対象は主にGemma 3や3nとなりますが、複数のmmprojモデルが作成され選択肢として用意されていたので、その違いも改めて知ることになりました。
2026年4月3日金曜日
Gemma 4 on LocalAI
何もしない(localAI v4.0.0)で.yamlを超手抜きで options: - use_jinja:trueだけ指定して実行すると下記の通りになります。
gemma-4n-e4b-it-Q8_0
Internal error: failed to load model with internal loader: could not load model: rpc error: code = Internal desc = Failed to load model: /usr/share/local-ai/models/gemma-4-E4B-it-Q8_0.gguf. Error: llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'gemma4'; llama_model_load_from_file_impl: failed to load model; llama_params_fit: encountered an error while trying to fit params to free device memory: failed to load model; llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'gemma4'; llama_model_load_from_file_impl: failed to load model
コンソール出力などにも同様のエラーが出ますが、チャットインタフェースでもエラーが表示されます。