画像認識で結構文字を拾ってたりしたのでOCR機能としては優秀なんだと勝手に思っていました…
結論から言うと、少なくても日本語に関しては万能ではなさそうです。
Gemma 4の画像認識がどの程度なのかを見ていてどの程度のものが倫理フィルターに引っかかってしまうのか気になったので試してみました。
何もしない(localAI v4.0.0)で.yamlを超手抜きで options: - use_jinja:trueだけ指定して実行すると下記の通りになります。
gemma-4n-e4b-it-Q8_0
Internal error: failed to load model with internal loader: could not load model: rpc error: code = Internal desc = Failed to load model: /usr/share/local-ai/models/gemma-4-E4B-it-Q8_0.gguf. Error: llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'gemma4'; llama_model_load_from_file_impl: failed to load model; llama_params_fit: encountered an error while trying to fit params to free device memory: failed to load model; llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'gemma4'; llama_model_load_from_file_impl: failed to load model
コンソール出力などにも同様のエラーが出ますが、チャットインタフェースでもエラーが表示されます。