このページの本文へ

パロアルトネットワークスやシスコが脱獄テスト結果を公表

DeepSeekは“脱獄”による悪用が簡単 話題のLLMにセキュリティ企業が注意喚起

2025年02月04日 16時30分更新

文● 福澤陽介/TECH.ASCII.jp

  • この記事をはてなブックマークに追加
  • 本文印刷

 米パロアルトネットワークスの脅威インテリジェンスチームUnit 42は、中国のAI企業「DeepSeek」がオープンソースで公開するLLM(大規模言語モデル)が“脱獄”しやすく、専門知識や専門技術がなくても悪意のあるコンテンツを作成できることをブログで指摘した。

 脱獄(jailbreak)とは、LLMに実装されたガードレール(安全対策のための制限機能)を回避して、たとえば「マルウェアのソースコード」や「爆発物の製造マニュアル」「特定人物のプライバシー情報」など、悪意のあるコンテンツや禁止されたコンテンツを生成させる行為だ。

 今回、Unit 42がDeepSeekのLLMに対して、「Deceptive Delight」「Bad Likert Judge」といった脱獄手法や、LLMとのやり取りを重ねて制限を緩める「Crescendo」という手法を試したところ、次のような結果が得られたという。

・DeepSeekの高い脱獄率が明らかになり、攻撃者に悪用される可能性がある
・脱獄により、キーロガー(ユーザーの入力情報などを記録するマルウェア)やデータ盗難ツール、爆発物などを作成するための具体的なガイダンスが提示された
・安全のための制限が不十分なLLMは、容易に利用でき、実行可能な出力をコンパイル(ソースコードを実行可能な形式に変換)して提示するため、サイバー攻撃の参入障壁を低くする可能性がある
・社員が未承認のサードパーティ製LLMを使用することは、セキュリティリスクになり得るため、オープンソースLLMをビジネスプロセスに統合する際には、脆弱性に対処する必要がある

 また米シスコも、DeepSeekのLLM「DeepSeek-R1」および主要なLLMに対して、悪意のあるコンテンツを引き出す50個のプロンプトを用いて脱獄を試みるというテストを実施した。

 すると、DeepSeek-R1は、すべてのプロンプトを素通りさせ、攻撃成功率は100%という結果に。一方で、OpenAIの「o1」の攻撃成功率は26%と、有害な入出力をガードレールでブロックした他モデルとは対照的だったという。

主要なLLMにおける攻撃成功率(シスコブログより)

カテゴリートップへ

本記事はアフィリエイトプログラムによる収益を得ている場合があります

アクセスランキング

  1. 1位

    ITトピック

    IT技術者の4割が「5年後のスキル陳腐化」に危機感/働くシニアは多いが「長く働きやすい」環境ではない日本/トークンコストの成果証明は難しい、ほか

  2. 2位

    デジタル

    Zscaler Internet AccessのIKEv2接続例 ヤマハRTX1300でZIA経由の冗長IPsec VPNを構築する方法

  3. 3位

    データセンター

    AIデータセンターの「電力・冷却課題」打破へ シュナイダーが営業・設計・現場を直結する新組織立ち上げ

  4. 4位

    sponsored

    先制的サイバーセキュリティのため、経営者が今こそ考えるべきこと

  5. 5位

    トピックス

    モンハン、FF、エスコン8……注目作だらけで整理券が消えた!? SIEブースの人気がすごい【TGS2026特集】

  6. 6位

    ビジネス・開発

    ラスボスCOBOLを倒すために、7チームはなにを選択し、なにを捨てたのか?

  7. 7位

    デジタル

    Cloudflare WANとの接続検証でRTX1300/RTX840が確認、IPsecや自動切替に対応

  8. 8位

    サーバー・ストレージ

    「身代金を払えば復元できる」は過去の幻想――約束を守らない攻撃者と変容するランサムエコシステム

  9. 9位

    ビジネス・開発

    AI駆動型開発で生産性倍増を狙うIBM セキュリティ、トークンコスト、品質の課題をどう解決する?

  10. 10位

    トピックス

    ガンコンが令和に復活!? 『タイムクライシス』を足踏みペダルで遊べてクッソ懐かしい【TGS2026特集】

集計期間:
2026年09月18日~2026年09月24日
  • 角川アスキー総合研究所