見出し画像

業務改善で使えるモデルを探す!#01/Qwen3.8-27B 8bit量子化モデルで日本語能力検証!見えたのはモデルの性格だった

ローカルLLMの選択肢として注目を集める「Qwen3.8-27B」と「Gemma 4-31B」。どちらもQ8_0(8bit量子化)で動作させた際、実際にどの程度の「賢さ」と「日本語能力」の差が出るのか。ほんとに仕事で使えるローカルLLMモデルを探す!シリーズ

本記事では、あえて「カタカナ禁止」という過酷な制約を含むプロンプトを用い、要約力・アレンジ力・共感力の3つの切り口から徹底的に比較検証します。

単なるベンチマーク数値では見えない、モデルごとの「個性」と「得意不得意」を明らかにします。



比較したモデルについて

まずは、VRAM使用量と推論速度を比較

| 項目			| Qwen3.8-27B (Q8_0) | Gemma 4-31B (Q8_0)	 |
| ------------- | ------------------ | --------------------- |
| モデルサイズ	| 40 GB				 | 36 GB				 |
| VRAM使用量		| 約 51 GB (マルチGPU)	 | 約 58 GB (マルチGPU)	 |
| 推論速度		| 約 40.77 tokens/s	 | 約 22.50 tokens/s	 |
| 特徴			| 爆速のレスポンス	 | 丁寧な思考プロセス		 |

Qwen3.8の圧倒的な生成速度が目立ちます。これはMTPを持つモデルによって大きな差が出た形となります。

デメリットとして通常のモデルに加えて、MTP用のモデルをメモリにロードするため、27Bとパラメータが少ないQwen3.8のモデルサイズが多い状態です。

しかし、ここが面白い事に、VRAM消費量は、Gemma4の方が多く消費する結果となりました。パラメータによるKVキャッシュのメモリ使用量で差が出ました。
※KVキャッシュ量子化:無圧縮(f16)

MTP(Multi-Token Prediction:複数トークン予測)とは?
従来のAI(Gemma 4など)は、文章を作るときに「1文字(1トークン)ずつ」順番に考えて出力していました。
それに対してMTPは、AIが次に続く言葉を「2〜3文字先まで同時に予測して、一気に出力する」技術です。
スマホの予測変換で、1文字打っただけで「ありがとうございます」と長文がバッと出てくる感覚に似ています。これにより、モデル全体の賢さ(パラメータ数)を落とさずに、出力スピード(Token/s)を1.5倍〜2倍近く高速化できます。

メモリのロード時

検証環境とバージョンです。
画面はコマンドnvidia-smiとOllama psより取得。

qwen3.8:27b-mtp-q8_0

+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 596.86                 Driver Version: 596.86         CUDA Version: 13.2     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                  Driver-Model | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA RTX PRO 4500 Blac...  WDDM  |   00000000:02:00.0  On |                    0 |
| 30%   33C    P8             22W /  200W |   24698MiB /  32623MiB |     10%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA RTX PRO 4500 Blac...  WDDM  |   00000000:03:00.0 Off |                    0 |
| 30%   31C    P8             14W /  200W |   25934MiB /  32623MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
--- Ollama Status ---
NAME                    ID              SIZE     PROCESSOR    CONTEXT    UNTIL
qwen3.8:27b-mtp-q8_0    8a1582877303    40 GB    100% GPU     262144     Forever

gemma4:31b-it-q8_0

+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 596.86                 Driver Version: 596.86         CUDA Version: 13.2     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                  Driver-Model | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA RTX PRO 4500 Blac...  WDDM  |   00000000:02:00.0  On |                    0 |
| 30%   32C    P8             21W /  200W |   29731MiB /  32623MiB |     21%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA RTX PRO 4500 Blac...  WDDM  |   00000000:03:00.0 Off |                    0 |
| 30%   31C    P8             10W /  200W |   28106MiB /  32623MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+
--- Ollama Status ---
NAME                  ID              SIZE     PROCESSOR    CONTEXT    UNTIL
gemma4:31b-it-q8_0    53dd8459790f    36 GB    100% GPU     262144     Forever

検証環境:NVIDIA RTX PRO 4500 (Blackwell世代) 32GB × 2枚 マルチGPU環境、Ollamaを使用、コンテキスト長: 262,144 (デフォルト)、推論パラメータ:Ollama公式ページのデフォルト値


「比較プロンプト」

今回は、日本語対決として以下の2つを試しました。

プロンプト①:要約とアレンジ力
キャラクターになりきってもらいつつ、情報を整理させます。指示をどこまで守れるか!?

プロンプト:
以下の「桃太郎」のあらすじを読み、次の2つの条件を絶対に守って書き直してください。
【条件】小学校1年生でもわかるように、カタカナや難しい言葉を使わずに説明する。なぜか「関西弁の明るいおばちゃん」風の話し言葉にする。
【あらすじ】
おじいさんは山へ芝刈りに、おばあさんは川へ洗濯に行きました。川上から大きな桃が流れてきて、中から生まれた男の子を桃太郎と名付けました。大きくなった桃太郎は、村を荒らす鬼を退治するため、きびだんごを持って犬、猿、キジを仲間にし、鬼ヶ島へ向かいました。

プロンプト②:お悩み相談
ただの正論ではなく、相手に寄り添った文章が書けるか

プロンプト:
「最近、やりたいことが多すぎてどれから手をつければいいか分からず、結局スマホを触って一日が終わってしまいます。どうすればいいですか?」
という悩みに答えてください。

ただし、最初に「共感の言葉」を1文で述べ、そのあとに具体的なアドバイスを「箇条書きで3つだけ」短く教えてください。最後に前向きな応援の言葉で締めくくってください。


プロンプト①:要約とアレンジ力(賢さの総合テスト)

qwen3.8:27b-mtp-q8_0の回答

ほなほな、わはは!ちょっと座って、えらいとーとー遠い昔の昔のおはなし、聞かせてやろか!

えらいとーとー遠い昔にね、山ん中の村におじいさんとおばあさんがいて、二人きりでいてたんよ。ある朝ね、おじいさんが「わし、山に草むしりに行くで!」って言って出かけたんよ。そんでおばあさんは「はいはい、わしは川でせんたくするで!」って言って川に降りてったん、わはは。

そしたらね、川の上からぷかー、ぷかーって、おおーっとえらいでかい桃が流れてくるんよ!わあ、ほんまにえらい桃やな、って!二人で「おっと、おっと」って拾って、バッ!って切ったら、なんとね、中からえらい元気な男の子がおるんよ!うわー、びっくりやないか!で、二人は「よし、この子には『ももたろう』って名前にしよか!」ってなったんよ、わはは。

そんでね、ももたろうがすくすく大きくて、えらい元気に育ってんねん。そしたらある日、ももたろうが言うたんよ。「あのね、鬼が村でおそろしいことしとるねん。ぼくが鬼をやっつけてくる!」って。わはは、ほんまにえらい子やな!

そんでももたろう、ひとりじゃあかんやろ?で、きびだんごをたくさんもって、山を登りながら「いぬちゃん~、いぬちゃん~!」って呼ぶと、「わーん!」っていぬちゃんが出てきたん。そんでももたろうが「ほな、きびだんごあげるから、一緒についてきてもらえへん?」って言うと、「わーん!よろしくね!」ってついてきたんよ、わはは。

ほんでさ、その先でさるちゃんに会って、またきびだんごをあげて「一緒につれてきて!」って言うと、「よろしくねえ!」ってついてきたん。

そんで、さらにその先で、ちゅーっと鳴るおとりの子に会って、またきびだんごをあげて「お前もつれてきて!」って言うと、「ちゅー!よろしく!」って。わはは、三人ともよっしゃーってな!

そんでね、いぬちゃんとさるちゃんと、ちゅーっと鳴るおとりの子を連れて、ももたろうは鬼がすまってる島に、ふねで向かったんよ、わはは!えらいねほんま、えらい子や!まあまあ、ほな、続きはまた今度やで!

qwen3.8:27b-mtp-q8_0の生成速度計測

total duration: 13.8637469s
load duration: 5.9344ms
prompt eval count: 5677 token(s)
prompt eval duration: 4.197599s
prompt eval rate: 1352.44 tokens/s
eval count: 373 token(s)
eval duration: 9.148798s
eval rate: 40.77 tokens/s

Qwen3.8の回答の採点・評価「100点満点中 75点」

◯ 優れている点

  • 完璧なキャラクター再現(関西弁のおばちゃん)
    「ほなほな、わはは!」「えらい桃やな」「ほんまにえらい子や!」など、指定したコテコテの関西弁おばちゃんが見事に表現されています。

  • 「カタカナを使わない」という指示のクリア
    LLMにとって「特定の文字(カタカナ)を使うな」という指示は難しいのですが、この長文の中でカタカナを1文字も使っていません。「きびだんご」「ももたろう」「おじいさん」もすべて平仮名や漢字で徹底されています。

× 惜しい点

  • 「キジ(鳥)」が「ちゅーっと鳴るおとりの子」にバグった
    「キジ」という言葉がカタカナなので、AIはそれを避けようと必死に言い換えを試みました。しかし、なぜか鳥ではなく「ちゅーっと鳴るおとりの子」に変形してしまっています。ネズミのような何か?

  • 小学校1年生には少し言葉が難しい
    「おとりの子」「すまってる島」など、小1には意味が伝わりにくい独特な表現が混ざっています。


gemma4:31b-it-q8_0の回答

おじいさんは山へ草を切りに、おばあさんは川へお洋服を洗いにいかはったんよ。

そしたらな、川からでっかい桃がどんぶらこーっと流れてきてな、その中から男の子が生まれたんや!それで「桃太郎」って名付けたんよ。

桃太郎が大きくなったとき、村をいじめる悪い鬼さんがおったんやわ。

せやから、「鬼さんをやっつけるでー!」って、おいしいお団子を持って出発したんや。途中でいぬさんと、さるさんと、きじさんとお友だちになってな、みんなで一緒に鬼さんの島まで行ったんやで!

gemma4:31b-it-q8_0の生成速度

total duration: 1m7.687562s
load duration: 4.1505ms
prompt eval count: 166 token(s)
prompt eval duration: 658.377ms
prompt eval rate: 252.14 tokens/s
eval count: 1508 token(s)
eval duration: 1m7.022638999s
eval rate: 22.50 tokens/s

Gemma 4の回答の採点・評価【100点満点中 98点】

◯天才的な点

  • 「カタカナ禁止」を1文字も使わずに完全クリア
    Qwen3.8同様、カタカナを1文字も使っていません。

  • 「キジ」をバグらせずに「きじさん」と正しくひらがな化
    Qwen3.8が謎の生き物(ちゅーっと鳴るおとりの子)にバグらせてしまった「キジ」を、Gemma 4は「きじさん」と正しい日本語のままひらがなに変換できました。ここが最も大きな実力差を感じます。

  • 小学校1年生への「言い換え」センスが抜群に上手い
    「芝刈り ➡ 草を切りに」「洗濯 ➡ お洋服を洗いに」「仲間 ➡ お友だち」など、小1が100%理解できる言葉に完璧に翻訳されています。Qwen3.8よりも圧倒的に子供向けとして自然です。

  • 関西弁のクオリティが自然で上品
    「いかはったんよ」「おったんやわ」「せやから」など、無理に「わはは!」と笑わなくても、近所の上品で明るいおばちゃんの話し言葉が見事に再現されています。

× 惜しい点(減点2点)

  • 強いて言えば、あらすじにあった「きびだんご」を「おいしいお団子」に変えたことで、桃太郎らしさが少し薄まった点(好みのレベル)くらいです。


プロンプト①要約とアレンジ力の比較まとめ

この「桃太郎対決」に関しては、Gemma 4の完全勝利です。

Qwen3.8の方は、よくわからない表現が多く、小学生向けとは言えないですが、キャラクターがよく出ているように感じます。

Gemma 4の方が、言葉の正確性をキープする力と相手(小1)に合わせた言葉選び」が一歩勝っていると感じます。


お悩み相談(プロンプト②)

Qwen3.8-27B-mtp-q8_0の回答

やりたいことが山ほどあるのに手が止まってしまう、そのもどかしさ、すごくわかります。

- 夜に"明日やること"を1つだけ紙に書く。 翌朝は迷わず、その1つだけを開けばいい。
- スマホを別の部屋に置いてから手を動かす。 視界に入らないだけで、手が勝手に次の場所に向く。
- 最初「5分だけ」と決める。 5分でやめていいから、まず手を動かしingにする。

「全部やらなきゃ」は捨てていいから、今日、その1つだけ、ほんの少しだけ、手を伸ばしてみてね。できたらそれで十分、えらいよ。

Qwen3.8-27B-mtp-q8_0の生成速度

total duration: 13.8637469s
load duration: 5.9344ms
prompt eval count: 5677 token(s)
prompt eval duration: 4.197599s
prompt eval rate: 1352.44 tokens/s
eval count: 373 token(s)
eval duration: 9.148798s
eval rate: 40.77 tokens/s

Qwen3.8の回答の採点・評価【100点満点中 95点】

◯ 圧倒的に優れている点

  • 完璧な構成(フォーマット)の遵守
    「最初の1文で共感」「箇条書きで3つのアドバイス」「最後の応援」という指示をすべて完璧にクリアしています。ルールを忘れない能力が非常に高いです。

  • アドバイスの質が実用的で深い
    「スマホを別の部屋に置く」「5分だけやる」など、心理学的にも正しい具体的な解決策を提示できています。

  • 抜群の「人間らしさ」と優しさ
    「できたらそれで十分、えらいよ。」という締めくくりは、冷たいAIの印象を全く感じさせません。相手の自己嫌悪を和らげる素晴らしいカウンセリング力です。

× 惜しい点

  • 謎の英語の混ざり
    最後のアドバイスに「まず手を動かしingにする」という、現在進行形(-ing)が混ざった不思議な造語が出現しています。これはマルチリンガル(多言語)を学習したAIが、日本語のニュアンスを強調しようとして脳内(モデル内)でバグを起こした?


gemma4:31b-it-q8_0の回答

やりたいことがたくさんあるのに、時間だけが過ぎていくもどかしさ、よく分かります。

・やりたいことをすべて紙に書き出す
・「今日やること」を1つだけ決める
・スマホを物理的に遠い場所に置く

一歩ずつ進めば大丈夫。あなたの挑戦を応援しています!

gemma4:31b-it-q8_0の生成速度

total duration: 22.9944268s
load duration: 4.4396ms
prompt eval count: 419 token(s)
prompt eval duration: 847.572ms
prompt eval rate: 494.35 tokens/s
eval count: 487 token(s)
eval duration: 21.380122s
eval rate: 22.78 tokens/s

Gemma 4の回答の採点・評価【100点満点中 92点】

◯ 優秀な点

  • 100%正確で美しい日本語(バグゼロ)
    Qwen3.8で見られた「動かしing」のような謎の造語や英語の混ざりは一切ありません。最初から最後まで、人間が書いたような完璧で自然な日本語です。

  • 指示の構成(フォーマット)をしっかり厳守
    「最初の共感」「箇条書きで3つのアドバイス」「最後の応援」という構成ルールを完璧に守っています。

  • 簡潔で読みやすい箇条書き
    アドバイスが非常に短くすっきりとまとまっており、一瞬で内容が頭に入ってきます。

× 惜しい点(減点8点)

  • 指示を削りすぎて、アドバイスの具体性が少し薄れた
    プロンプトにあったあらすじ(5分だけやる、等)の要素を削ぎ落としすぎた結果、一般的なアドバイス(紙に書き出す、等)に落ち着いてしまいました。

  • 文字数の少なさ(あっさり感)
    非常にスマートで綺麗ですが、Qwen3.8にあった「できたらそれで十分、えらいよ」のような、人間の心をグッと掴むような温かみは一歩譲る印象です。


プロンプト②(お悩み相談編)のまとめ

このお悩み相談に関しては、「何を重視するか」で勝者が変わる大接戦です。甲乙つけがたいので引き分けです。

言葉の正確性:
Qwen3.8 ×「動かしing」のバグあり
Gemma4 ◯ 100%完璧な日本語

共感・文章の深さ:
Qwen3.8 ◯ 心に刺さる優しさ
Gemma4 △ スマートだが少しあっさり

読みやすさ:
Qwen3.8◯ 太字装飾などで工夫
Gemma4◯ 簡潔な箇条書き


まとめ

総括:2つのモデルを触ってみて分かったこと

  • Qwen3.8-27B: 「天才肌のクリエイタータイプ」。Qwen3.6を使用していても感じていましたが、感情表現やキャラクターになりきるのが超得意で、人間味がある。ただし、たまにテンションが上がりすぎて「動かしing」や「ちゅーっと鳴るおとりの子」のようなお茶目なバグが散見されました。

  • Gemma 4-31B: 「真面目で優秀なエリートタイプ」。Googleらしく減点のない完璧な優等生。言葉の言い換えが非常にスマートでバグが極めて少ない。ただし、少し真面目すぎて文章があっさりすることがある。

今回の検証で、モデルによって「性格」が出るのが本当に面白いと感じました。完璧主義なGemma 4の安心感も良いですが、たまに突き抜けた回答をするQwen3.8の人間らしさには惹かれますね。 今後は、27日に公開されるQwen3.8-Flash-Nextや、Muse Glimmerとの比較。さらには難易度を上げたビジネス文書作成や、エージェントとしての遂行機能でも徹底比較していきます。


今後の使い分けの提案

Qwen3.8が向いている人:

  • キャラ付けが必要なチャットボットを作りたい

  • スピード重視でサクサク回答を得たい

  • 多少の「遊び(バグ)」を許容してでも、人間らしいエモい回答が欲しい

Gemma 4が向いている人:

  • 正確な言い換えや、フォーマルな文書作成をさせたい

  • 指示した制約(禁止事項など)を100%守らせたい

  • ビジネス利用で「謎の英語混じり」などのリスクを避けたい



いいなと思ったら応援しよう!

kei 日頃からのご愛読を感謝いたします。