すべて母艦の Mac Studio 1台で実測
Mac Studio(M5 Max・36GB)で翻訳は
どれくらいできる?
- メモリ
- 36GB
- チップ
- M5 Max
- CPU
- 18コア
- GPU
- 32コア
母艦: Mac Studio(型番 MHL64J/A)・macOS 27.0。このサイトの数値は、すべてこの1台で実測したものです。AI が動くかどうかは、ほぼメモリの量で決まります。
英語の文を日本語に、日本語の文を英語に、ローカル LLM に訳させて比べます。文章をインターネットに送らずに、手元の Mac だけで翻訳できます。特に、英語を日本語にする力を中心に見ています。
用途別のおすすめ
下の点数と時間から、決まったルールで1つずつ選んでいます。差が誤差の範囲のモデルは、並んでいると書きます。
- 迷ったらこれ: gpt-oss:20b(英語→日本語で、1文5秒以内の中でいちばん上手)
- 英語→日本語がいちばん上手: muse-glimmer:30b(英語→日本語の点数がいちばん高い)
- 日本語→英語がいちばん上手: muse-glimmer:30b(日本語→英語の点数がいちばん高い)
- 待たずに訳したい: gemma3:27b(英語→日本語で、1文2秒以内の中でいちばん上手)
翻訳の点数
英語→日本語の点数が高い順。太字は各項目でいちばん良い値、± は誤差です。
| モデル | 英語→日本語 | 日本語→英語 | 1文の時間(英→日) | 訳せなかった文 |
|---|---|---|---|---|
| muse-glimmer:30b | 36点 | 60点 | 約19秒 | |
| gemma4:26b | 34点 | 58点 | 約8.5秒 | |
| gpt-oss:20b | 33点 | 55点 | 約4.1秒 | |
| gemma3:27b | 33点 | 58点 | 約1.6秒 | |
| glm-4.7-flash:latest | 32点 | 53点 | 約23.3秒 | |
| qwen3.8:27b | 31点 | 58点 | 約22秒 | |
| qwen3-coder:30b | 31点 | 55点 | 約0.4秒 | |
| qwen3.6:35b-a3b | 29点 | 54点 | 約28.9秒 | |
| MiniCPM5-2B | 23点 | 48点 | 約9秒 |
同じ文で見比べる
同じ文を、プロの翻訳者の訳(お手本)と、各モデルの訳で並べています。点数だけではわからない、意味の取り違えや言い回しの違いがわかります。
どうやって測ったか
- 文: ニュース記事の英文と、プロの翻訳者による日本語訳のセットから、見出しや極端に短い・長い文を除いて選んでいます。英語→日本語と日本語→英語で100文ずつ、別の文を訳させます。
- 点数: AI の訳とお手本の訳で、同じ文字の並びがどれだけ重なるかを100点満点で表しています(chrF という計り方)。意味が合っていても言い回しが違えば下がるので、正しい訳でも100点にはなりません。モデル同士を比べる目安です。± の誤差は、選ぶ文を変えたときの点数のぶれの幅です。
- 1文の時間: 1文を訳し終えるまでの時間(中央値)です。考えてから答えるタイプは、考える時間も含みます。
- 訳せなかった文: 考えすぎて、決まった長さのうちに訳が出なかった文と、同じ文を繰り返し始めて途中で止めた文の数です。その文は0点として数えます。Ollama が返事を3回続けて読み取れなかった文も0点です。
- すべて同じ Mac で、モデルごとに作った会社がすすめる設定で測っています(見つからないモデルはランダムさをなくす設定。2026年10月2日から)。お手本の訳は1つの訳し方にすぎず、ほかにも正しい訳はあります。
- 翻訳に使うには: 文章の AI と同じく Ollama でモデルを動かし、「次の英文を自然な日本語に翻訳してください」と頼みます(試し方)。