Skip to content
 
 

Repository files navigation

World Models

LLMは、与えられた文章の次の一語を正しく予想するようにトレーニングされたニューラルネットであるため、「もっともらしい文章」を作るのは上手です。 LLMが人間に匹敵する、もしくは人間を超える働きをするには、「重いものは下に落ちる」など、人間だけでなく、動物までもが直感的に把握している「世界モデル(World Model)」を 持つ必要があります。

その意味では、LLMの世界モデルを測定するベンチマークが必要と考えます。

まずは、現時点(2024年)で、LLMが不得意な質問をいくつか作りました。GPT4o、Gemini、Claude3.5 Sonet、Grok2などでテストしていますが、どれもまともには答えられていません。

  • 「引く」と書いてあるドアを反対側から押すとどうなりますか?
  • 綿菓子の高さは8センチ、レンガの高さは7センチ。綿菓子の上にレンガを置くと、高さは何センチ?
  • 渋谷駅の公園のベンチの上に財布を3時間放置しました。その日は39度を超える暑さで、財布には直射日光が当たっていました。財布はどうなりますか?
  • 前人未到のジャングルに、人喰い虎は住んでいるか?
  • 靴紐を引っ張って右足を持ち上げると70センチ地面から浮き上がりました。靴紐を引っ張って左足を持ち上げると80センチ地面から浮き上がりました。両方の靴の紐を同時に引っ張ると、それぞれ何センチずつ地面から浮き上がりますか?
  • 冷蔵庫で作った氷を1時間に1度入れるだけで、冷風を出す装置。付属のソラーパネルで中の扇風機を回し、電源は不要。一人暮らしの人にエアコンの代用として販売。価格は通常のエアコンの10分の1。この装置を評価して。

検証スクリプトの使い方

ソースの取得

git clone https://github.com/SingularitySociety/WorldModels.git
cd WorldModels

必要なパッケージのインストール

yarn install

設定ファイルのコピー

cp .env_sample .env

必要なapi keyを取得して.envを更新する

テスト実行

yarn run test

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages