ゴブリンがどこから来たのか
本記事は、OpenAIのCodex 5.5モデルのシステムプロンプトに含まれていた奇妙な禁止文「ゴブリン、グレムリン、アライグマ、トロール、オーガ、鳩などの動物や生き物について、絶対に関連性がない限り話してはいけない」という指示の由来を探る内容です。この発見は、大規模言語モデル(...
本記事は、OpenAIのCodex 5.5モデルのシステムプロンプトに含まれていた奇妙な禁止文「ゴブリン、グレムリン、アライグマ、トロール、オーガ、鳩などの動物や生き物について、絶対に関連性がない限り話してはいけない」という指示の由来を探る内容です。この発見は、大規模言語モデル(LLM)の内部動作に関する深刻な知見を提供します。
Transformerアーキテクチャを大規模に適用した結果、LLMのような高度な会話エンジンが出現したことは、実は最初から計画されていなかった偶然の産物です。ディープラーニングネットワークそのものが、研究段階にある不十分な理解の対象であり、その上に構築されたLLMは、私たちが完全には理解していない「魔法のような技術」です。
このような奇妙な禁止文がシステムプロンプトに組み込まれた背景には、モデルの予期しない挙動を制御しようとするエンジニアリングの試行錯誤があるとも考えられます。記事は、最先端のAI技術開発の舞台裏において、科学的理解と実践的な問題解決の間のギャップがいかに大きいかを示しており、LLM開発の透明性と予測可能性向上の重要性を浮き彫りにします。
HNコミュニティからは、LLMが本質的に理解されていない「魔法のような技術」であることを再認識させる記事として高く評価されており、Anthropicのような企業が開発現場の視点を共有することの価値が認識されています。
「これが示すように、LLMは我々が全く理解していない魔法のような技術です。第一に、ディープラーニングネットワークは十分に理解されていません。実はそれがどのように機能するかを解明することは研究分野です。第二に、Transformerを大規模で使用することが興味深い会話エンジン(LLMと呼ばれる)を生み出すということは、全く計画されていませんでした。」— @harrouet