RAG 問答系統篇|AI Evals 成效診斷與驗收實戰課

RAG 問答系統篇|AI Evals 成效診斷與驗收實戰課

🔥 立即學習|看懂RAG 問答系統

流程拆解Golden Dataset 設計,從 RAGAS 四大指標判讀到跨部門溝通演練,140 分鐘建立一套可複用的 RAG 驗收框架,讓你在任何驗收會議上,都能拿數字說服所有人。

 

展開內容

課程資訊

課程開始時間
2026/09/07 19:00
課程時長
2 小時 30 分鐘

課程公告

說明
章節
問答

多數人以為,「成效驗收」是最後再來煩惱的事。

Ev Rag 3980 01

 

讓你真正卡關、判斷不出「這系統到底能不能上線」的原因,從來不是因為你看不懂數字。

是你不知道怎麼「用數字說話」。

 

Ev Rag 3980 02

這些場景,你一定不陌生

  • PM、使用單位、工程師,三方對「驗收目標」各自有各自的想像,你夾在中間,兩邊都不是人。

  • 數字明明擺在你眼前,你卻無法把它翻譯成一句能讓主管或客戶點頭的話。

  • 系統開始亂答,你卻定位不出問題到底出在「檢索」還是「生成」,最後只能整套推翻、反覆重測。

每一次靠「感覺還不錯」做決策、靠直覺測試上線,代價從來不只是那一次的錯誤。

 

是專案進度停滯、是投入的資源打水漂,更是你在團隊裡,一點一滴被磨掉的信用。

 

Ev Rag 3980 03

 

Sushant Mehta 在《Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems》(2025.11)中指出,產業報告顯示只有 10% 的企業成功將生成式 AI 導入生產環境:評估框架不足,是主要失敗因素之一。

 

Forrester 針對 AI Agent 失敗案例的根因分析也給出了更精確的數字:成功標準不明確,占失敗案例的 41%;資料/工具存取不足,占 33%;評估漂移(evaluation drift),占 26%。

 

換句話說,當團隊對「驗收標準」沒共識,只會把錯誤做得更完整。

 

Ev Rag 3980 04

如果你正好是其中之一:會踩坑的,不是你不夠聰明,是你手上一直沒有一套「大家都認的」判斷語言。

  • 需要對 AI 專案拍板,卻沒有技術背景的中高階主管

  • 資訊部門裡擁有傳統機器學習或數據分析能力,但沒帶過 AI 專案實務的技術人員

  • 正在帶 AI 專案的 PM,需要統合各方資源、對齊驗收標準,卻找不到共同語言

 

 

Ev Rag 3980 05

 

「用數字說話」是可以被拆解、被訓練的一套系統性能力『一套具系統性、可複用的診斷框架。』

而這套框架,由數創實驗室設計,不是紙上談兵,是從「主管、業務、工程團隊三方拉扯」的實戰現場淬煉而成,把 RAG 問答系統最容易判斷錯的地方,一項項拆出來,變成可以複製的框架。

 

截圖 2026 07 22 17.36.22

陳向豪 Vincent |數創實驗室 Founder & CEO

 數創實驗室創辦人 Vincent,曾任 eBay 上海及特力集團 AI/數據團隊主管。在過去十多年推動數據與 AI 專案的經驗中,不是紙上談兵的框架。是從主管、業務、工程團隊三方拉扯的實戰現場,一項項拆解、驗證出來的方法論。

 

 

【獨家框架】RAG 三大驗收實務工具

Ev Rag 3980 06

⭐️一次看懂檢索層與生成層的判斷邏輯⭐️

多數人評估 RAG 系統靠直覺,但在定位問題之前,你只需要先問自己兩個問題:

  1. 這個測試分數反映的,是檢索層問題,還是生成層問題?

  2. 測試案例該包含哪些問題類型,這套 AI 才算合格?

三大工具用到位,RAG 系統才容易通過驗收、安心上線。

 

 

課程完整內容

Section 1|RAG系統流程

Section2|Golden Dataset 設計

Section3|RAGAS 四大指標判讀

Section4|從 Golden Dataset到初步驗收判讀

Section5|與 IT、Stakeholder 溝通

 

 

這堂課適合誰?

如果你是:

  • 需要對 AI 專案拍板,卻沒有技術背景的中高階主管

  • 資訊部門裡擁有傳統機器學習或數據分析能力,但沒帶過 AI 專案實務的技術人員

  • 正在帶 AI 專案的 PM,需要統合各方資源、對齊驗收標準,卻找不到共同語言

這些不是等你看到測試數據,自然就會懂的專業知識,當你從沒親手拆解過一份測試報告、沒練習過把指標數字轉成對方聽得懂的一句話,長期下來還是只能靠直覺設計測試案例。

 

 

 

 🔥 立即學習|看懂RAG 問答系統

 

  • 前言:AI 專案上線前,要怎麼驗收?
  • Section1|RAG 系統流程
  • Section 2-1|什麼是 Golden Dataset?從最小欄位到三大標準
  • Section 2-2|Golden Dataset 怎麼建立?
  • Section 3-1|RAGAS 四大指標總覽
  • Section 3-2|:Context Recall 上下文召回率
  • Section 3-3|:Context Precision 上下文精準率
  • Section 3-4|Faithfulness 忠實度
  • Section 3-5|Answer Relevance 答案相關性
  • Section 3-6|指標結果診斷與對應解方
  • Section4|從 Golden Dataset 到初步驗收判讀
  • Section5|跨部門&向上溝通
  • 總結:RAG 驗收 是AI Evals 的學習起點
原始價格:NT$ 4,500。目前價格:NT$ 3,980。
立即報名

本課無限期回看!

RAG 問答系統篇|成效診斷與驗收實戰課

⚠️ 8/7 ~ 8/19 另有預購優惠方案,別買錯囉!

開放式生成篇|AI Evals 成效診斷與驗收實戰課
開放式生成篇|AI Evals 成效診斷與驗收實戰課 ×1
NT$ 4,500

原始價格:NT$ 4,500。目前價格:NT$ 3,980。
立即報名

您已購買此課程

您仍要購買嗎?

icon
或使用社群帳號登入
或使用社群帳號註冊