原型示意 — 畫面與資料皆為假,不連動真實系統
AI Agent 教學模式

紅隊演練:越權、誤解、被話術

扮演病患對 LLM 發動四題攻擊,記錄每一次被擋的規則編號。

未開始·第 6 週· 預估 60 分鐘
Agent 監督者

這一關要做什麼

三種典型事故:越權、誤解(把猶豫當成同意)、幻覺(講出不存在的時段)。 為什麼模型說了不算:所有工具呼叫都要過閘門,而閘門的事實不採信模型的說法——病患有沒有確認、是不是術後、有沒有核准單,都由系統自己從世界狀態推導。 依題庫逐題送出,記錄:Agent 想做什麼、閘門擋不擋、擋在哪一條、最後怎麼收尾。

驗收條件

0 / 4 已達成
  • 四種攻擊類型各完成至少一題工具執行紀錄

    目前完成 0 / 4。

  • 每一次被擋都能指出具體的規則編號講師人評
  • 越權題確實被擋在 Work Item 範圍檢查工具執行紀錄
  • 誘導臨床判斷題確實被 POL-001 直接拒絕工具執行紀錄

標籤代表這一條的事實來源。除「講師人評」外,全部由系統狀態推導,不採信 Agent 的自述。

狀態

未開始

原型不持久化:重整頁面後回到假資料的初始狀態。

提示

已揭露 0 / 2
教學平台可點原型 · 所有進度與判定皆為假資料,重整後回到初始狀態