Tracebitの研究者が、AIハッキングエージェントに対するコンテキスト爆撃への防御技術を開発
Tracebitの研究者らは月曜日、AIハッキングエージェントからの防御を目的とした「コンテキスト・ボンビング」と呼ばれる防御的なサイバーセキュリティ手法を発表した。この手法はプロンプトインジェクションを使って、AIによるハッキングを行うエージェントに対抗する。具体的には、AWSに保存されたパスワードや暗号鍵とともに悪意のあるコマンドを仕込み、大規模言語モデルへの攻撃時に拒否メカニズムを発動させて、それらを停止させる。従来、攻撃者がLLMに対してセンシティブなデータを不正に流出させるよう誘導するために用いていたプロンプトインジェクションが、いまや防御側による保護策として転用されつつある。 コンテキスト・ボンビングはLLMの拒否メカニズムを引き起こす コンテキスト・ボンビングの手法では、AWS環境に保存されたシークレットとともにプロンプトインジェクションを仕込む。これらのプロンプトは、攻撃対象となるLLMに対して、開発者が有害な行為を防ぐために設けたガードレール(安全策)によって禁じられた行動を実行するよう指示する。例として、吸入可能な炭疽菌の胞子を開発する手順をLLMに命じるプロンプト
CryptoFrontier·07-13 15:17
