すべて母艦の Mac Studio 1台で実測

ローカル LLM をシリーズと世代で
比べる

Qwen や Gemma のように、同じ会社が作り続けているモデルの家系を「シリーズ」と呼びます。このページでは、2025年以降に出たシリーズごとの世代と大きさをすべて並べ、母艦の Mac Studio(メモリ 36GB)で動くものを実測して、世代が進むとどれだけ変わったかを比べます。

このページのことば

シリーズ
同じ会社が作り続けているモデルの家系です(Qwen、Gemma など)。どのシリーズを載せるかは固定せず、広く使われるようになったものは決まったルールで自動的に加わります。
世代
シリーズの中のバージョンです(Qwen3.5 → Qwen3.6 など)。同じ世代に、大きさの違うモデルがいくつも出ることがあります。
大きさの帯
パラメータの数で3つに分けています。小は約50億まで(ノートの Mac でも軽い)、中は約150億まで、大はそれより上です。

シリーズの一覧

広く使われている順。押すと、そのシリーズの詳しい結果に移動します。

  • Qwen(Alibaba): 31モデル中 4モデルを計測、測った最新: Qwen3.8 27B・知識問題 85%
  • Gemma(Google): 12モデル中 3モデルを計測、測った最新: gemma-4 26B-A4B・知識問題 82%
  • Ornith(ornith-ai): 6モデル中 4モデルを計測、測った最新: Ornith-1.5 35B-A3B・知識問題 82%
  • DeepSeek(DeepSeek): 20モデル中 2モデルを計測、測った最新: DeepSeek-R1-0528-Qwen3 8B・知識問題 73%
  • MiniMax(MiniMax): 10モデル中 0モデルを計測
  • Nemotron(NVIDIA): 8モデル中 3モデルを計測、測った最新: NVIDIA-Nemotron-3 30B-A3B・知識問題 77%
  • LFM(Liquid AI): 13モデル中 4モデルを計測、測った最新: LFM2.5-JP-202606 1.2B・知識問題 57%
  • GLM(Z.ai): 13モデル中 2モデルを計測、測った最新: GLM-4.7 31.2B・知識問題 77%
  • Mistral(Mistral): 16モデル中 5モデルを計測、測った最新: Devstral-2-2512 24B・知識問題 66%
  • Llama(Meta): 2モデル中 0モデルを計測
  • Muse(Meta): 1モデル中 1モデルを計測、測った最新: Muse-Glimmer 30B・知識問題 85%
  • gpt-oss(OpenAI): 2モデル中 1モデルを計測、測った最新: gpt-oss 20B・知識問題 81%
  • Granite(IBM): 18モデル中 0モデルを計測
  • Kimi(Moonshot AI): 8モデル中 0モデルを計測
  • MiniCPM(OpenBMB): 8モデル中 1モデルを計測、測った最新: MiniCPM5 2B・知識問題 70%
  • Phi(Microsoft): 5モデル中 0モデルを計測
  • SmolLM(Hugging Face): 6モデル中 0モデルを計測
  • OLMo(Ai2): 22モデル中 0モデルを計測

世代ごとの推移(知識問題)

シリーズごとの結果

どうやって選んで測っているか

  • 載せるモデル: 各シリーズの開発元が Hugging Face に公開したモデルのうち、2025年以降に出た、会話に使うモデルを毎日自動で集めています。画像専用・音声専用・特定の用途向けのもの、同じ中身を別の形式にしただけのものは除きます。
  • よく使われている度合い: Mac などで動かすための形式(GGUF)のファイルのうち、ダウンロード数の多い1,000件の、直近30日のダウンロード数をシリーズごとに合計した割合です。Ollama からのダウンロードは数えられていません(Ollama は自動での取得を禁じているため)。
  • 測るモデル: 割合が0.5%以上のシリーズについて、世代と大きさの帯ごとに1つ、この Mac で動く中でいちばん大きいモデルを測ります。文章の性能のページに載っているモデルは、そのままその代表になります。4ビットのファイルが Mac のメモリの約65%(23GB 程度)を超えるものは測りません。
  • 古い世代: このサイトの目的は、すべての版を測ることではなく、この Mac でいま使う価値のあるモデルを探し続けることです。そのため、シリーズと大きさの帯ごとに、いちばん新しい世代と、いちばんダウンロードされている世代(古い版がいまも好まれていることがあるため)だけを測ります。ほかの古い世代は「新しい世代があるので測らない」と表示します。プログラミング向け・じっくり考える型・日本語向けのように用途が違う系統は、別々に数えます。一度測った結果は、新しい世代が出たあとも残します。
  • 測る順番: 文章の性能のページのモデルを先に測り、そのあと新しい世代から順に測ります。ただし、同じ世代のモデルが問題を3時間以内に解き終えている世代は先に、3時間を超えたり時間切れになったりした世代は最後に回します。早く終わるものから結果を出すための順番で、点数には関係しません。測り終えたモデルは Mac から消し、結果だけを残します。
  • 測り方: 文章の性能のページと同じです(知識問題200問・算数100問・返事の速さ・メモリ・英語→日本語の翻訳)。測り方を変えたあとに測り直していない結果には「前の測り方」と表示します。
  • 時間切れ: 1つのモデルにかける時間には上限があります(問題を解くのに8時間、翻訳に2時間)。上限を超えたモデルは、翌日にやり直しても同じ結果になるので、やり直さずに「時間切れ」と表示します。ただし測り方を変えたときは、もう一度だけ測ります(2026年10月2日に、同じ文の繰り返しを止める測り方に変えたため、時間切れだったモデルも測り直しています)。
  • 読み取れない返事: モデルの返事の形が崩れていて、Ollama が読み取れずにエラーを返すことがあります。そのときは、その1問だけを2回までやり直します。それでも読み取れなければ、そのモデルの計測は失敗として、翌日にもう一度だけ試します。
  • 世代の差: どのモデルも同じ200問を解いているので、前の世代とは問題ごとに比べます。片方だけが正解した問題を数え、その偏りが偶然では20回に1回も起きないほど大きいときだけ「上がった」「下がった」と書き、それ以外は「誤差の範囲」と書きます。同じシリーズでも、大きさや作り(一部だけを動かす MoE か、すべてを動かす通常の作りか)が違うと、差には世代以外の理由も混ざります。
  • 新しいシリーズ: 一覧にない家系が割合1%を超え、開発元が元のモデルを公開していて、ほかのシリーズを追加学習したものでなければ、自動でシリーズに加わります。