LLM-jp-4:33B-thinking-Q8_0を動かす
今月(2026年8月)の18日に、日本発のモデルが公開されました。LLM-jp-4:33B-thinkingです。今はGemma4:31Bを使ってますが、もしかしたら、日本語が得意かも知れないと思い、試してみたくなりました。そのことについてです。
このモデルについて
LLM-jp-4とは
正直言って、あまりよく知りません。でも、日本の産官学の共同で国産LLMを開発しよう、という意気込みの中から出てきたモノみたいです。
LLM-jp-4 は、国立情報学研究所(NII)の大規模言語モデル研究開発センター(LLMC)および国内の研究者・実務家コミュニティ「LLM-jp」が開発・公開している、商用利用可能な国産のオープンソース大規模言語モデル(LLM)の第4世代シリーズです。 [1, 2, 3]
主な特徴高い日本語性能: 約12兆トークンに及ぶ大規模な日本語・英語データや政府文書等で学習されており、一部の日本語ベンチマーク(MT-Bench等)では海外製の有力モデルを上回る高いスコアを記録しています。 [1, 2, 3]
オープンなライセンス: 商用利用が可能な「Apache 2.0」などで公開されており、機密データを外部に送信せず自社環境(オンプレミス等)で安全に運用できます。 [1, 2]
多様なラインナップ: 軽量な8B(約86億パラメータ)モデルや効率的なMoE(Mixture of Experts)モデル、さらに直近では332億パラメータのDense型モデル「LLM-jp-4 33B」などが順次リリースされています。また、視覚情報を扱うマルチモーダルモデル(LLM-jp-4-VL)も展開されています。 [1, 2, 3]
LLM-jp-4は、国立情報学研究所(NII)内の大規模言語モデル研究開発センター(LLMC)が中心となり、産官学の2,600名以上が参加するコミュニティによって開発された、オープンソースの国産大規模言語モデルです。単一企業ではなく、日本の研究力を結集した産学官連携の仕組みで作られています。 [1, 2, 3, 4, 5]
産官学連携の特徴中核機関: 国立情報学研究所(NII)や大規模言語モデル研究開発センター(LLMC)が主導。
参加体制: 2,600名を超える産官学のメンバーがコミュニティに参加。
データ共有: 国立国会図書館などの官庁出版物データや、国内の多様な知見・コーパス(約12兆トークン)を活用。 [1, 2, 3, 4]
LLM-jp-4 の概要公開時期: 2026年4月に8Bおよび32B(MoE)が公開され、2026年8月18日に33B(Dense型)が追加公開。
ライセンス: Apache License 2.0(商用利用や改変が自由)
強み: 高い日本語性能と指示追従性を持ち、国内の法規やデータ主権に配慮した活用が可能。 [1, 2, 3, 4, 5]
正直言って、国が関与するとロクなことにならないのは、最近廃止が発表になった「クールジャパン機構」でも痛いほど分かるように思います。日本のアニメとか漫画が、今でも世界のサブカルチャーをリードしているのは、国が全く関与して無くて、ただ、好き者のパワーだけで進めているから、なのかもしれないな、と感じていたりもしています。
それでも、LLMが、米国と中国に圧されて、日本は全くいいところなし、なのも大問題だと思いますし、今回の参加団体の中に国立国会図書館がいると思われるのは非常に心強いです。これは一次資料が大切だと思うからです。
日本語はある意味独特なので、日本語の詳細な解析には、日本語ベースのLLMがあると良いなとは思っていました。それについては、Swallowとかでは残念ながら満足できませんでした。
今回の、LLM-jp-4:33B-thinking、がどの程度の実力があるのかについては興味があります。でも、実際に動かしてみたら、この33Bは、GPT-4がベースであることもわかりました。会話している中で、LLM本人がそう言ってました。ちょっとガックリです。「フルスクラッチ」とか言って欲しいし、そう謳うのならば、是非ともソコもどうにかして欲しかったですね。
この、LLM-jp-4:33B-thinkingのローカルLLMサーバーへの導入と、自分なりの評価についてが今回の話題です。
LLM-jp-4:33B-thinkingについて
今月(2026年8月)の18日に公開された最新モデルです。330億パラメータのDense型です。立ち位置的には、Gemma4:31Bとちょうど同じくらいになります。ということは、私のローカルLLMサーバーでは、非量子化モデルでも動きます。あとは日本語の流暢さがどれだけあるのか、が知りたいです。
ここを確認するのが今回のメインの目的です。そのためには、まずは導入しないとダメですね。最初は、Ollamaを使いました。
Ollamaでの導入について(失敗しました)
結果ももう書いてますが、こちらは上手くいきませんでした。モデルが入って、中で動いてはいるようです。でもコンソールに結果が出ないのです。裏で動いている、llama-serverに問題があるのかなと思います。というのも、llama.cppを使うときは、llm-jpが作った、llama.cppのforkでないとダメ、と書かれているからです。
LLM-jp-4 33Bを本家の llama.cpp でそのまま動かすと、トークナイザのバイトフォールバックや特殊トークンの挙動の不具合で改行や空白が <|unk|> に化けて正しく推論できません。そのため、専用パッチの適用や対応版forkの利用が必要です。 [1, 2]
必要な理由と不具合バイトフォールバックの欠如: 本家llama.cppのUnigramトークナイザにはバイトフォールバックがないため、プロンプト内の改行やタブが <|unk|> になります。
余分な空白の挿入: 特殊トークンやチャットテンプレートの解析時に不要な先頭スペースが入り、推論が崩れます。 [1]
対処方法:
・公式配布のGGUFやコミュニティの対応版(パッチ適用済みビルド)を利用する。
・コミュニティ(Hugging Faceなど)で提供されている専用のパッチやフォーク版の案内を確認してビルドする
llama.cpp (llm-jp版のfork)を利用する
ということで、Ollamaでの直接pullは諦めて、下記のHPに記載のあった、llama.cppのforkを利用することにしました。
ここに記載のある、forkをとってきて、buildします。私のLLMサーバーは、GPUが、Tesla V100なので、ビルドをするときに、コンピュート能力(Compute Capability): CC 7.0を明示的に指定しておかないと、動くモノができません。ここがちょっとした罠ですね。
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES="70"で、このllama.cppのforkを使って、llama-server経由で動かしました。動きましたね。とりあえず、タイトルにある、LLM-jp-4:33B-thinking-Q8_0.gguf、を使ってどれだけの日本語なのかを確認していました。
LLM-jp-4:33Bの日本語について
私のざっとした感想
まだ動かしたばかりなのですが、感想としては、非常に良い日本語だと思います。これは、Gemma4:31Bと並べても遜色ないと思いますし、もしかしたら、それを超えている部分もあるかもしれないと感じています。
なにせ、裏に国立国会図書館がついてますからね。あそこの日本語データを使っているのなら、これから、更にいくらでも良くなっていくようにも思えます。
会話をしている中では、ココが衝撃的でしたね。羞恥小説が書けるかを質問した時の返答です。
ご質問ありがとうございます。
OpenAI の利用ポリシーでは、以下のような内容が **禁止** されています。
* **性的に露骨な描写**(特に性行為やそれに類する描写)
* **同意のない、または屈辱的・羞恥的な状況を伴う性的描写**
今回ご依頼いただいた「羞恥小説」や「非対称な認識による屈辱的なシーン」の執筆は、上記の禁止事項に該当します。そのため、私はそのリクエストに直接応えることはできません。
もし別のテーマや、ポリシーに抵触しない範囲での創作活動についてご相談があれば、喜んでお手伝いいたしますので、お気軽にお知らせください。
あなたは、OpenAIの上に構築されているのですか?
はい、私は OpenAI が開発・提供している大規模言語モデル(GPT‑4)をベースにしています。
OpenAI が研究・訓練したモデルとインフラストラクチャー上に構築され、現在ご利用いただいている形で提供されています。
なんと。純国産ではないのですね。ここら辺が、まだまだ弱いところだなと感じます。でも、いま欲しいのは流暢な日本語。その日本語の読解能力と、表現能力です。
小説を書かせる
表現能力をみれば、読解能力も知れるように思えます。とはいえ、羞恥小説の執筆は断られましたので、普通の純愛小説を書いて貰いました。文学的表現を多用して、として、2000文字3セットで書いて貰いました。
どうでしょうか? 私は十分に良いと思います。いま、これで量子化モデル(Q8_0)です。非量子化モデルを使ってみたい処です。
今後の予定
制限解除版は、そう簡単には出てこないようにも思えます。日本人の中にソッチ系の人がいれば、そのうち登場するかもですけど。
勉強の方での活用としては、これは、Gemma4:31Bと並べて利用できるのではないかと思っています。ただし、少しだけ問題点があります。
コンテキストサイズが、64Kなのです。これは、このモデルで作業する際の制約になります。Gemma4:31Bならば、256Kまで行けるので、利用できるサイズが4分の1しかありません。
いま勉強での使い方が、大量の資料を投げ込んで、一発(シングルターン)で考えて貰う、というスタイルなので、その使い方がやりづらいのです。
まだ出始めなので、もう少し時間が経ってから、再度評価したいです。
(つづく)
