はじめての方へ

モデル名の読み方

「gemma-4-E4B-it」「30B-A3B」「Q4_K_M」のようなモデル名は、ハイフンで区切られた部品の組み合わせです。世代・大きさ・仕上げ方・圧縮の種類など、部品ごとの読み方を例で説明します。

ローカル LLM が初めてなら、先に始め方をどうぞ。

例:gemma-4-E4B-it

  1. gemma名前
    (Google のシリーズ)
  2. 4世代
    (第4世代)
  3. E4B大きさ
    (実質40億)
  4. it仕上げ方
    (会話用)

ハイフンで区切られた部品を、前から順に読みます。どの部品があるか、どんな順番かはモデルによって違いますが、使われる部品の種類はだいたい決まっています。

名前と世代

書き方意味例
gemma-4 / Qwen3.5 / LFM2.5シリーズの名前と世代(版)。数字が大きいほど新しい。gemma-4-E4B-it / Qwen3.5-4B
Nemotron-3-Nano-4B数字が2つあるときは、B が付いているほうが大きさ、付いていないほうが世代。NVIDIA-Nemotron-3-Nano-4B-BF16
v2同じモデルの改訂版(バージョン2)。NVIDIA-Nemotron-Nano-12B-v2

大きさ

書き方意味例
4B / 12b / 32Bパラメータ(AI の「脳」の部品)の数。B は Billion(10億)で、4B は40億。小文字の b も同じ。大きいほど賢くなりやすいが、メモリを使い、遅くなりやすい。Ornith-1.0-9B / DeepSeek-R1-Distill-Qwen-32B
E4BE は Effective(実質)。ファイルの部品はもっと多いが、工夫して実質40億ぶんの重さで動く。gemma-4-E4B-it
30B-A3B / 35b-a3b全部で300億あるうち、1回に動かすのは30億(A は Active)。メモリは全体の30B ぶん要るが、速さは3B に近い。この作りを MoE(専門家の混合)と呼ぶ。NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 / qwen3.6:35b-a3b
Nano / Mini / Small / Flash大きさや速さの呼び名。何B なのかは会社ごとにばらばらなので、数字のほうを見る。Mistral-Small-3.2-24B-Instruct-2506 / glm-4.7-flash:latest

メモリの目安:Q4_K_M に縮めたモデルなら、10億あたり約0.7GB(このサイトの実測)。9B なら約6GB、14B なら約10GB です。MoE は全体の数で考えます。自分の Mac で動くかはメモリ別のおすすめで確かめられます。

仕上げ方・得意なこと

書き方意味例
it / Instruct / Chat指示に従って会話できるように仕上げた版。ふつう使うのはこちら。gemma-4-E4B-it / Ministral-3-14B-Instruct-2512
Base仕上げる前の素の版。文章の続きを書くだけで、会話には向かない。何も付いていない名前は、会社によって会話用のことも素の版のこともある(Qwen は素の版に Base と付ける)。—
Thinking / Reasoning / R1考えてから答えるタイプ。返事の前に考える手順を書くので、難しい問題に強いが、返事まで待つ。DeepSeek-R1-0528-Qwen3-8B
Distill大きいモデルの答え方を小さいモデルに教え込んだ版。「R1-Distill-Qwen-32B」は、DeepSeek-R1 の考え方を Qwen の32B に教えたもの。DeepSeek-R1-Distill-Qwen-32B
Coderプログラミング向けに仕上げた版。qwen3-coder:30b
JP日本語向けに仕上げた版。LFM2.5-1.2B-JP-202606
VL / Vision文章だけでなく画像も読める版。—

出た時期

書き方意味例
2512 / 2506年と月。2512 は2025年12月。Ministral-3-14B-Instruct-2512 / Magistral-Small-2506
0414 / 0528月と日。0414 は4月14日。年月か月日かは会社によって違う。GLM-4-9B-0414 / DeepSeek-R1-0528-Qwen3-8B
202606年と月(6桁)。2026年6月。LFM2.5-1.2B-JP-202606

ファイルの形式と圧縮

書き方意味例
GGUFOllama などで使えるファイルの形式。このサイトで測ったモデルは、ほとんどこの形式。gemma-4-12b-it
MLXApple シリコンの Mac 向けの形式(LM Studio などで使う)。—
Q4_K_M圧縮(量子化)の度合い。Q4 は1つの数を約4ビットに縮めたもの、K は縮め方の種類、M は中くらい(S 小・M 中・L 大:大事な部分をどれだけ細かく残すか)。小さく速くなるかわりに、賢さが少しだけ下がる。このサイトの標準。—
Q8_08ビットに縮めたもの。元の賢さにほぼ近いが、大きさは Q4 の約2倍。—
BF16 / F16縮めていない元の細かさ(16ビット)。大きさは Q4 の約3.5倍。NVIDIA-Nemotron-3-Nano-4B-BF16
MXFP44ビットの別の縮め方。gpt-oss は最初からこの形で配られている。gpt-oss:20b

Ollama での書き方

書き方意味例
gemma4:12bコロンの前がモデルの名前、後ろがタグ(大きさや圧縮の種類)。gemma4:26b
glm-4.7-flash:latestlatest は「おすすめの版」。タグを省くとこれになる。glm-4.7-flash:latest

Hugging Face のファイルを Ollama で使うときは、次のような長い名前になります。

  1. hf.coHugging Face
    から
  2. unsloth配った人
    ・会社
  3. gemma-4-12b-it-GGUFリポジトリ名
    (モデル名+形式)
  4. Q4_K_Mどの圧縮の
    ファイルか

配った人がモデルを作った会社とは限りません。この例では、Google が作ったモデルを unsloth が GGUF の形にして配っています。

名前からわからないこと