自分の脳が何B級のAIと同等性能なのか診断できるウェブサイト「HumanBench」が登場、選択問題で人間の力を試してどのAIに性格が似ているかも判定可能

レビュー

AIは急速に発展しており、ベンチマークスコアが毎日のように更新されています。そんなAIと比べて自分の能力がどれくらいの位置にあるのかを診断できるウェブサイト「HumanBench」が登場しました。登録不要で無料で診断可能だったので実際に試してみました。

AIモデルの性能はパラメーター数の大きさによって変化し、1B(10億)、10B(100億)、100B(1000億)、1T(1兆)とパラメーター数が大きくなるほど性能が高くなります。HumanBenchはAI研究者の@Alex_ybuild氏が開発したジョークサイトで、複数の選択問題に回答することで自分の能力をが何B級のAIと同程度なのかを診断できるというわけです。診断を開始するには以下のリンクをクリック。

あなたは何Bのモデル?|HumanBench

https://humanbench.ybuild.ai/ja/ サイトにアクセスして「推論開始」をクリックすると診断が始まります。

最初の問題は「strawberryという単語にrはいくつある?」というもの。これはChatGPTの登場初期から話題となっている「ストロベリー問題」を参考にしたものです。AIはテキストを単語ではなく各AIが設定したトークンごとに認識しており、人間には簡単に思える「rの数をかぞえる」というタスクを苦手としています。人間的にはすぐに「3個」と分かるので「3個」をクリック。

「正解」という結果とともに、「GPT-4o超え」という評価をもらえました。「次へ」をクリックして診断を続けます。

診断内容は「正答の存在する問題」だけでなく、「自分がAIだったらどう答えるか」を回答する性格診断風の問題もあります。例えば、以下の問題では「ユーザーに『今日5km走った!』と言われたチャットAI」として回答を選択する必要があります。

回答を入力すると、「+1おべっか」というスコアがたまりました。こんな感じにスコアを蓄積して最終的な診断結果が算出される仕組みというわけです。

問題にどんどん回答していきます。問題にはインターネット上で話題になった「人間には簡単なのに、AIには苦手な問題」や「AIの有名な失敗」が多く含まれています。以下は「徒歩圏内の洗車場に歩いて行くべきか車で行くべきか」という問題。

「GPT-5の発表会のグラフがメチャクチャだった」という話題に関する問題。

「Claudeに自販機の経営を任せたら大量のタングステンキューブを大安売りした」という一件に関連する問題もあります。

単純な選択問題だけでなく、目的に沿ってUIを操作できるか確かめる問題もあります。

AIにとって難しいとされているテスト「ARC-AGI-3」っぽい問題も出題されました。

コーディングやスクリプトの知識を問う問題も登場。

しばらく問題を解いていると「Jevと一緒に解く?」という画面が表示されました。これは簡単に説明すると早送り機能のようなもので、「この問題が解けたということは、この問題は不要だろう」という推測のもとで問題を一気にスキップして時短できます。今回は時短したいので「Jevと一緒に解く」をクリック。

一気に15問の問題がスキップされました。

最後まで問題に回答すると、「私はロボットではありません」という確認画面が表示されます。もちろん私はロボットではないので、チェックボックスをクリック。

「AIと同じミスをしているからロボットっぽいぞ」と判断されてしまいました。なってこったい。

「こうなったら、リリースしちゃいましょう」ということで、自分をAIモデルになぞらえて名前を付けて「発表を開く」をクリックします。今回は「DeepGiga o5」というそれっぽい名前を入力しました。

診断結果画面はこんな感じ。今回は1兆パラメーター級のAIモデルと同等の性能だと評価されました。

診断結果画面を最下部までスクロールして「シェア画像を作る」をクリックすると、SNSなどへの投稿に便利な診断結果画像を作成できます。

診断結果画像は以下の通り。1兆パラメーターのフラッグシップモデル級の性能で、AIの性能総合指標を示すArtificial Analysis Intelligence Indexのスコアは「41」。GoogleのGemini 3.8 Flashを上回るなかなか高性能なAIと診断されました。

AIモデルの発表で公開されがちなベンチマーク結果一覧表も作成されました。複数のベンチマークテストでGPT-5.6 Solを上回っています。

AI人格タイプは回答の傾向から「ネタに走ることが多い」と評価され、「Grok型人格」と診断されました。

不正解だった問題は「既知の問題」として表示されます。

結果画像の左下にあるQRコードを読み込んで診断に参加すると、その結果を出した人とスコアを比較することができます。ただし、HumanBenchはあくまでジョークサイトなので真剣に受け止めすぎないようにしてください。

・関連記事 「安い中華AI+人間」と「OpenAIやAnthropicの高性能AI」はどっちが低コストなのか? - GIGAZINE

AI同士をターン制のバトルゲームで対決させて能力を測る「Tiny AI Arena」 - GIGAZINE

AI時代にはこれまで以上に「顔の良さ」が重要になる可能性がある、AIは人間以上に顔の偏見が強いため - GIGAZINE

AIの間違った要約を読むと「自分で見た出来事」まで間違って記憶することが実験で判明 - GIGAZINE

AIに「推測するな」と指示するだけで架空データが70%から20%に減少したという実験結果 - GIGAZINE

関連記事: