はじめての方へ
モデル名の読み方
「gemma-4-E4B-it」「30B-A3B」「Q4_K_M」のようなモデル名は、ハイフンで区切られた部品の組み合わせです。世代・大きさ・仕上げ方・圧縮の種類など、部品ごとの読み方を例で説明します。
ローカル LLM が初めてなら、先に始め方をどうぞ。
例:gemma-4-E4B-it
gemma名前
(Google のシリーズ)4世代
(第4世代)E4B大きさ
(実質40億)it仕上げ方
(会話用)
ハイフンで区切られた部品を、前から順に読みます。どの部品があるか、どんな順番かはモデルによって違いますが、使われる部品の種類はだいたい決まっています。
名前と世代
| 書き方 | 意味 | 例 |
|---|---|---|
gemma-4 / Qwen3.5 / LFM2.5 | シリーズの名前と世代(版)。数字が大きいほど新しい。 | gemma-4-E4B-it / Qwen3.5-4B |
Nemotron-3-Nano-4B | 数字が2つあるときは、B が付いているほうが大きさ、付いていないほうが世代。 | NVIDIA-Nemotron-3-Nano-4B-BF16 |
v2 | 同じモデルの改訂版(バージョン2)。 | NVIDIA-Nemotron-Nano-12B-v2 |
大きさ
| 書き方 | 意味 | 例 |
|---|---|---|
4B / 12b / 32B | パラメータ(AI の「脳」の部品)の数。B は Billion(10億)で、4B は40億。小文字の b も同じ。大きいほど賢くなりやすいが、メモリを使い、遅くなりやすい。 | Ornith-1.0-9B / DeepSeek-R1-Distill-Qwen-32B |
E4B | E は Effective(実質)。ファイルの部品はもっと多いが、工夫して実質40億ぶんの重さで動く。 | gemma-4-E4B-it |
30B-A3B / 35b-a3b | 全部で300億あるうち、1回に動かすのは30億(A は Active)。メモリは全体の30B ぶん要るが、速さは3B に近い。この作りを MoE(専門家の混合)と呼ぶ。 | NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 / qwen3.6:35b-a3b |
Nano / Mini / Small / Flash | 大きさや速さの呼び名。何B なのかは会社ごとにばらばらなので、数字のほうを見る。 | Mistral-Small-3.2-24B-Instruct-2506 / glm-4.7-flash:latest |
メモリの目安:Q4_K_M に縮めたモデルなら、10億あたり約0.7GB(このサイトの実測)。9B なら約6GB、14B なら約10GB です。MoE は全体の数で考えます。自分の Mac で動くかはメモリ別のおすすめで確かめられます。
仕上げ方・得意なこと
| 書き方 | 意味 | 例 |
|---|---|---|
it / Instruct / Chat | 指示に従って会話できるように仕上げた版。ふつう使うのはこちら。 | gemma-4-E4B-it / Ministral-3-14B-Instruct-2512 |
Base | 仕上げる前の素の版。文章の続きを書くだけで、会話には向かない。何も付いていない名前は、会社によって会話用のことも素の版のこともある(Qwen は素の版に Base と付ける)。 | — |
Thinking / Reasoning / R1 | 考えてから答えるタイプ。返事の前に考える手順を書くので、難しい問題に強いが、返事まで待つ。 | DeepSeek-R1-0528-Qwen3-8B |
Distill | 大きいモデルの答え方を小さいモデルに教え込んだ版。「R1-Distill-Qwen-32B」は、DeepSeek-R1 の考え方を Qwen の32B に教えたもの。 | DeepSeek-R1-Distill-Qwen-32B |
Coder | プログラミング向けに仕上げた版。 | qwen3-coder:30b |
JP | 日本語向けに仕上げた版。 | LFM2.5-1.2B-JP-202606 |
VL / Vision | 文章だけでなく画像も読める版。 | — |
出た時期
| 書き方 | 意味 | 例 |
|---|---|---|
2512 / 2506 | 年と月。2512 は2025年12月。 | Ministral-3-14B-Instruct-2512 / Magistral-Small-2506 |
0414 / 0528 | 月と日。0414 は4月14日。年月か月日かは会社によって違う。 | GLM-4-9B-0414 / DeepSeek-R1-0528-Qwen3-8B |
202606 | 年と月(6桁)。2026年6月。 | LFM2.5-1.2B-JP-202606 |
ファイルの形式と圧縮
| 書き方 | 意味 | 例 |
|---|---|---|
GGUF | Ollama などで使えるファイルの形式。このサイトで測ったモデルは、ほとんどこの形式。 | gemma-4-12b-it |
MLX | Apple シリコンの Mac 向けの形式(LM Studio などで使う)。 | — |
Q4_K_M | 圧縮(量子化)の度合い。Q4 は1つの数を約4ビットに縮めたもの、K は縮め方の種類、M は中くらい(S 小・M 中・L 大:大事な部分をどれだけ細かく残すか)。小さく速くなるかわりに、賢さが少しだけ下がる。このサイトの標準。 | — |
Q8_0 | 8ビットに縮めたもの。元の賢さにほぼ近いが、大きさは Q4 の約2倍。 | — |
BF16 / F16 | 縮めていない元の細かさ(16ビット)。大きさは Q4 の約3.5倍。 | NVIDIA-Nemotron-3-Nano-4B-BF16 |
MXFP4 | 4ビットの別の縮め方。gpt-oss は最初からこの形で配られている。 | gpt-oss:20b |
Ollama での書き方
| 書き方 | 意味 | 例 |
|---|---|---|
gemma4:12b | コロンの前がモデルの名前、後ろがタグ(大きさや圧縮の種類)。 | gemma4:26b |
glm-4.7-flash:latest | latest は「おすすめの版」。タグを省くとこれになる。 | glm-4.7-flash:latest |
Hugging Face のファイルを Ollama で使うときは、次のような長い名前になります。
hf.coHugging Face
からunsloth配った人
・会社gemma-4-12b-it-GGUFリポジトリ名
(モデル名+形式)Q4_K_Mどの圧縮の
ファイルか
配った人がモデルを作った会社とは限りません。この例では、Google が作ったモデルを unsloth が GGUF の形にして配っています。
名前からわからないこと
- 同じくらいの大きさ(70億〜100億)でも、知識問題の正答率は Ornith-1.0-9B が83%、GLM-4-9B-0414 が66%と大きく違います。
- 返事の速さ、日本語の得意さ、翻訳のうまさも名前ではわかりません。文章のページや翻訳のページで、実際に測った結果を見てください。