
- 登入
- 註冊
從流程拆解到 Golden Dataset 設計,從 RAGAS 四大指標判讀到跨部門溝通演練,140 分鐘建立一套可複用的 RAG 驗收框架,讓你在任何驗收會議上,都能拿數字說服所有人。
展開內容
⚠️ 若您已參加過 6、7 月《AI 成效診斷與驗收實戰課》實體課程,本課程內容高度重疊,建議不需重複購買,歡迎將名額留給尚未上過課的朋友 🙏

讓你真正卡關、判斷不出「這系統到底能不能上線」的原因,從來不是因為你看不懂數字。

PM、使用單位、工程師,三方對「驗收目標」各自有各自的想像,你夾在中間,兩邊都不是人。
數字明明擺在你眼前,你卻無法把它翻譯成一句能讓主管或客戶點頭的話。
系統開始亂答,你卻定位不出問題到底出在「檢索」還是「生成」,最後只能整套推翻、反覆重測。
每一次靠「感覺還不錯」做決策、靠直覺測試上線,代價從來不只是那一次的錯誤。

Sushant Mehta 在《Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems》(2025.11)中指出,產業報告顯示只有 10% 的企業成功將生成式 AI 導入生產環境:評估框架不足,是主要失敗因素之一。
Forrester 針對 AI Agent 失敗案例的根因分析也給出了更精確的數字:成功標準不明確,占失敗案例的 41%;資料/工具存取不足,占 33%;評估漂移(evaluation drift),占 26%。

如果你正好是其中之一:會踩坑的,不是你不夠聰明,是你手上一直沒有一套「大家都認的」判斷語言。
需要對 AI 專案拍板,卻沒有技術背景的中高階主管
資訊部門裡擁有傳統機器學習或數據分析能力,但沒帶過 AI 專案實務的技術人員
正在帶 AI 專案的 PM,需要統合各方資源、對齊驗收標準,卻找不到共同語言

「用數字說話」是可以被拆解、被訓練的一套系統性能力『一套具系統性、可複用的診斷框架。』
而這套框架,由數創實驗室設計,不是紙上談兵,是從「主管、業務、工程團隊三方拉扯」的實戰現場淬煉而成,把 RAG 問答系統最容易判斷錯的地方,一項項拆出來,變成可以複製的框架。

數創實驗室創辦人 Vincent,曾任 eBay 上海及特力集團 AI/數據團隊主管。在過去十多年推動數據與 AI 專案的經驗中,不是紙上談兵的框架。是從主管、業務、工程團隊三方拉扯的實戰現場,一項項拆解、驗證出來的方法論。

⭐️一次看懂檢索層與生成層的判斷邏輯⭐️
多數人評估 RAG 系統靠直覺,但在定位問題之前,你只需要先問自己兩個問題:
這個測試分數反映的,是檢索層問題,還是生成層問題?
測試案例該包含哪些問題類型,這套 AI 才算合格?
三大工具用到位,RAG 系統才容易通過驗收、安心上線。
Section 1|RAG系統流程
Section2|Golden Dataset 設計
Section3|RAGAS 四大指標判讀
Section4|從 Golden Dataset到初步驗收判讀
Section5|與 IT、Stakeholder 溝通
如果你是:
需要對 AI 專案拍板,卻沒有技術背景的中高階主管
資訊部門裡擁有傳統機器學習或數據分析能力,但沒帶過 AI 專案實務的技術人員
正在帶 AI 專案的 PM,需要統合各方資源、對齊驗收標準,卻找不到共同語言
這些不是等你看到測試數據,自然就會懂的專業知識,當你從沒親手拆解過一份測試報告、沒練習過把指標數字轉成對方聽得懂的一句話,長期下來還是只能靠直覺設計測試案例。
本課無限期回看!
⚠️ 8/7 ~ 8/19 另有預購優惠方案,別買錯囉!