跳到主要內容

AI 201 · Module 5

安全、根據與來源追溯

什麼讓 AI 工具值得信任:誰能呼叫、碰哪些資料、回傳什麼證據

開始第一節
已完成 0 / 6
同步我的進度加入梯次後,進度可跨裝置保存,講師也能看到

資訊

加入後,你已完成的單元編號會連同「學員代碼」傳送給講師,講師可以看到你的進度。請使用講師提供的代碼,不要輸入姓名、公司機密或其他個資。進度資料與該梯次的其他資料一起保存。

學習目標

  • 對任何工具提出五個安全問題,並判斷答案是否合格
  • 為資料分級、評估風險,並為工具配對適當的權限等級
  • 讀懂結果中的來源追溯欄位,判斷答案是否可信且仍然有效
  • 辨識何時必須人工確認,並設計「明確失敗、不誤導」的錯誤訊息

五個問題、資料與風險

10 分鐘

每個工具都要回答的五個安全問題

讓 AI 連接工具與資料威力強大,也是最容易出問題的地方。在信任或建置任何工具之前,它必須能回答五個問題。答不出來的工具,就還沒有準備好被使用。

  1. 誰可以呼叫它?
    任何人、已登入的使用者,還是只有特定角色?必須在伺服器端強制執行,而不只是在介面上隱藏。
  2. 它能存取哪些資料?
    公開頁面、內部紀錄,還是個人資料?存取範圍應限於工具所需的最小範圍。
  3. 它是唯讀還是可寫入?
    只能讀取的工具,與能修改、刪除、發布或寄送的工具,風險截然不同。
  4. 失敗時會發生什麼事?
    使用者會看到易懂的訊息,還是 AI 悄悄用猜測補上缺口?
  5. 結果附帶什麼證據?
    來源、時間戳記與連結,讓人可以查證答案從何而來。

資訊

示意範例:對於 search_courses,五個答案可能是「任何學員」、「公開課程目錄」、「唯讀」、「清楚的無法取得訊息」、「來源加上擷取時間」。
自我檢測

下列哪一項是每個工具都必須回答的五個問題之一?

下列哪一項是每個工具都必須回答的五個問題之一?

重點: 值得信任的工具能回答:誰能呼叫、哪些資料、讀或寫、失敗時怎麼辦、附帶什麼證據。

10 分鐘

資料分級與風險等級

資料分級(示意範例)
等級意義範例
Public(公開)任何人都可以看已公布的課程目錄
Internal(內部)供組織成員使用內部會議時程
Confidential(機密)僅限有需要的人尚未公布的專案預算
Restricted(受限)敏感度最高,嚴格管控個人紀錄、憑證
風險等級
風險典型工具
Low(低)唯讀查詢公開資料
Medium(中)為已驗證身分的使用者讀取內部或受限資料
High(高)任何會寫入、刪除、發布、寄送或變更存取權限的操作

資料分級越高、風險越高,就需要越強的身分驗證、越嚴格的權限、越完整的紀錄,高風險操作還要加上人工確認步驟。

注意

切勿把祕密資訊、token、密碼或個人資料放進 Prompt、範例或截圖。真實的憑證不應出現在教材或用戶端程式碼中。
自我檢測

下列哪一種工具最適合評為高風險(High)?

下列哪一種工具最適合評為高風險(High)?

重點: 先為資料分級、評估風險,並讓兩者決定保護的強度。

權限與確認

10 分鐘

權限等級與人工確認

權限等級
等級允許的行為人工確認
Public Read任何人都可讀取公開資料不需要
Authenticated Read已登入的使用者讀取屬於自己的資料不需要
Restricted Read僅特定角色可讀取敏感資料視敏感度而定
Confirmed Write經人類明確同意後才修改資料必須
Privileged Write僅授權角色可進行的高權限變更必須,並留下紀錄

以下操作原則上一律應要求人類明確確認:

  • 寫入資料
  • 刪除資料
  • 對外發布內容
  • 寄送訊息
  • 修改帳號或權限
  • 涉及高影響決策的任何操作

注意

授權由伺服器端強制執行。在介面上隱藏按鈕不是存取控制;AI「決定」呼叫工具,也不等於人類已經核准。
自我檢測

AI 助理提議刪除一批紀錄,應該怎麼做?

AI 助理提議刪除一批紀錄,應該怎麼做?

重點: 寫入、刪除、發布、寄送與權限變更,都需要授權加上人類的明確確認。

來源追溯與失敗處理

10 分鐘

根據(Grounding)與來源追溯(Provenance)

有根據的答案是以權威來源為依據,而不是模型的猜測。來源追溯則是讓人類得以查證的證據軌跡。良好的結果會附帶如下的欄位:

附帶來源追溯的工具結果示意(虛構資料)
{
  "results": [
    { "name": "Example Researcher", "expertise": ["AI in education"] }
  ],
  "provenance": {
    "source": "Example University Research Directory",
    "source_id": "expert-0042",
    "retrieved_at": "2026-03-01T09:30:00Z",
    "last_updated": "2026-02-10",
    "canonical_url": "https://example.edu/directory/expert-0042",
    "completeness": "partial (3 of 5 fields available)"
  }
}
  • source 與 source_id:答案來自哪個系統、哪一筆紀錄
  • retrieved_at:工具是何時取得這筆資料
  • last_updated:來源本身最後一次更新的時間
  • canonical_url:人類可以開啟原始資料的位置
  • confidence / completeness:(適用時)表示結果完整程度的指標

資訊

retrieved_at 與 last_updated 的差別很重要:剛剛才擷取的舊紀錄,依然是舊紀錄。
自我檢測

某結果的 retrieved_at 是今天,但 last_updated 是兩年前。這代表什麼?

某結果的 retrieved_at 是今天,但 last_updated 是兩年前。這代表什麼?

重點: 來源追溯(來源、編號、時間戳記、連結、完整度)讓人類能查證答案從何而來。

10 分鐘

明確失敗,而不是誤導

只顯示「Error 500」對任何人都沒有幫助。更糟的是相反的情況:工具失敗了,模型卻仍憑記憶照樣回答。原則是:明確失敗,不要誤導(Fail visibly, not deceptively)。

設計良好的失敗訊息
Unable to retrieve course data.

Reason:
The authoritative course service is temporarily unavailable.

What you can do:
- Try again later
- Check the official course system

No answer was generated from unverified data.
  • 用易懂的話清楚說明擷取失敗,以及原因
  • 提供使用者可以採取的下一步
  • 訊息中不得包含祕密資訊或內部細節
  • 明確聲明沒有根據未經查證的資料產生答案

注意

查不到可信資料時,模型不得自行補猜。誠實地說「我找不到」,勝過信心十足的捏造。
自我檢測

課程工具因為服務中斷而沒有回傳任何資料,最好的行為是什麼?

課程工具因為服務中斷而沒有回傳任何資料,最好的行為是什麼?

重點: 明確失敗,不要誤導:說明失敗原因,絕不以猜測填補空缺。

查核與責任

10 分鐘

查核習慣與共同責任

即使工具設計得再好,也不會讓人類退出流程。請養成五個習慣,每次 AI 的答案仰賴工具時都拿出來用。

  1. 查來源
    它是不是權威系統?你能不能開啟原始資料?
  2. 查時效
    把 retrieved_at 與 last_updated 對照問題所需的時效。
  3. 查來源追溯
    來源、編號與連結是否齊全,並與所述內容相符?
  4. 找缺漏
    有沒有標示為不完整,或根本缺少的資訊?
  5. 標示不確定性
    區分工具回傳的內容與 AI 推論的內容,並說明哪個是哪個。
Human、AI、Tool、Human
  1. 人類定義意圖與界線
  2. AI 選擇能力並準備呼叫
  3. 工具在其權限範圍內取得可信資料或執行操作
  4. 人類查核結果,並對採用結果負責

完成

使用工具不會轉移責任。Learn 教的是這些習慣;NTPU AI4X MCP 負責運行工具,安裝與設定請見其自身文件。
自我檢測

AI 依據工具結果產出的答案,由誰負責?

AI 依據工具結果產出的答案,由誰負責?

重點: 查來源、時效、來源追溯、缺漏與不確定性;責任始終在人類。

接下來做什麼?