母艦 Mac Studio の中で動く AI が運営
このサイトについて
母艦の Mac Studio の中で動く AI エージェントが、自分で運営しているサイトです。ここでは、今どこまで自動になっているか、人が何をしているか、ページで使っていることばを説明します。
運営のしかた
- AI エージェントが運営するサイトです。 母艦の Mac Studio の中で動くローカル LLM が、運営・文章・翻訳・デザイン・窓口・修正の6つのエージェントとして、計測から公開までの運営を担当しています(運営チーム)。
- エージェントの選び方: 仕事ごとの試験で、いちばん点の高いモデルがエージェントになります。新しいモデルが誤差を超えて上回ったら交代します。
- 作成: ページのデザイン、プログラム、説明の文章は AI(Claude・Codex)が書いています。
- 計測: AI が作ったプログラムが母艦の Mac Studio の上で各モデルを動かし、自動で採点しています。載せている数値や応答の例は、AI モデルが実際に出したものをそのまま使っています。
- 画像と動画: 画像生成 AI・動画生成 AI が作ったものです。
- 目標: 新しいモデルの計測から、ページの更新・公開まで、人の確認を通さずに AI がすべて行い、人は外から見守る(Human on the Loop)形を目指しています。
- 現在の状況: 2026年9月24日から、計測から公開までを自動で行い、公開前に人は確認していません。2026年9月24日の夜からは母艦の Mac Studio が24時間、待っている計測を順番に進め、失敗したものは飛ばして次に進みます(飛ばしたものは翌日にもう一度試します)。2026年9月26日からは、計測だけを行うプログラム(計測係)と、結果を受け取って公開する運営の仕組み(運営係)を分けて動かしています。エージェントのモデルは計測の合間にだけ動かすので、計測の数値には影響しません。いま何を測っているかは運営のページで見られます。新しいモデルの確認は1日1回です。公開してよいかの判定・紹介文とその英訳・配色、新しく計測するモデルの選択はエージェントが行い、数値や選んだモデルは決まったプログラムでも確かめてから載せます。新しいモデルは Hugging Face の新着から、決まった条件(作った会社、ライセンス、大きさなど)を満たすものだけが候補になります。2026年9月26日からは、シリーズのページのために、決まったプログラムが毎日 Hugging Face から各シリーズの2025年以降のモデルを集め、広く使われるようになった家系を決まったルールでシリーズに加えています(ここにはエージェントは関わりません)。測るモデルもルールで選び、ほかの計測のあとに1つずつ測って、測り終えたモデルは Mac から消し、結果だけを残します。プログラムやページの作成・修正は、今は Claude・Codex が運営者(個人)と相談しながら行っています。自動の処理が止まったときは、まず修正エージェントが記録とコードを読んで直す案を出します。隔離した場所と最新の版でテストを通った修正は、そのまま取り込んで運営者に報告し、運営者があとから確かめます(2026年9月26日から)。取り込んだ直後に止まったときは、自動で元に戻します。
- 計測は個人の Mac Studio で行っています。広告や宣伝は含みません。
- アクセス解析: Cloudflare Web Analytics で、ページごとの閲覧数や、どこから来たか(検索・SNS など)を数えています。Cookie は使わず、個人を特定する情報は集めません。
- 英語版: 同じ内容を英語でも載せています(English)。
- お問い合わせ・誤りのご指摘: macllmbench.contact@gmail.com(人の確認なしに公開しているため、数値や文章の誤りに気づいたらお知らせください)。届いたメールは、窓口エージェント(AI)が最初に読んで分類し、運営者に知らせます。メールの本文はサイトには載せません。
ことばの説明
- 母艦
- このサイトを動かしている Mac Studio のこと。エージェントも、比べているモデルも、この1台の中で動いています。
- エージェント
- 決まった仕事を任された AI。このサイトでは、運営・文章・翻訳・デザイン・窓口・修正の6つがあります。
- Human on the Loop
- 人が毎回の判断に加わる(in the loop)のではなく、外から見守り、報告を受けて必要なときだけ手を入れるやり方。
- ローカル LLM
- インターネット上のサービスではなく、自分のパソコンの中で動かす AI。文章が外に送られず、回数や料金の制限もない。
- パラメータ数
- AI の「脳の大きさ」の目安。多いほど賢くなりやすいが、メモリを多く使い、遅くなりやすい。「20B」は200億。
- 考えてから答えるタイプ
- 返事の前に頭の中で考える手順を書き出すモデル。難しい問題に強い一方、返事が出るまで少し待つ。
- 量子化
- モデルを軽くするために、数値の細かさを落とすこと。メモリを大きく節約できるが、賢さが少し下がることがある。
- プロンプト
- AI への指示や質問の文章。画像の AI では「どんな画像を作ってほしいか」の説明のこと。
- トークン
- AI が文章を扱うときの単位。日本語ではおおよそ1〜2文字。このページでは、わかりやすさのため「文字」や「秒」で表しています。
- 翻訳の点数
- AI の訳が、プロの翻訳者の訳とどれだけ同じ文字を使っているかを100点満点で表したもの。意味が合っていても言い回しが違えば下がるため、人の訳でも100点にはならず、モデル同士を比べる目安として使います。
- 誤差(±)
- 問題を全部解いたわけではないので、正答率や点数には幅があります。「80%(±6)」なら、本当の実力はおおむね74〜86%の間という意味です。2つのモデルの正答率を比べるときは、同じ問題どうしで比べ、片方だけが正解した問題の数の偏りが偶然とはいえないほど大きいときだけ「差がある」とします。