隨著生成式AI與大型語言模型(LLM)技術快速發展,確保AI系統在醫療場域的可靠性與安全性已日益受到重視。為呼應台灣《人工智慧基本法》所強調的透明度與可解釋性原則,國際獨立第三方檢測機構德國萊因(TÜV Rheinland)針對長聯科技自主研發之醫療照護機器人「愛寶(EirBot)」所搭載的「長聯LLM衛教生成模組」完成測試評估,並出具測試報告。本次評估聚焦AI生成內容的可靠性及來源可追溯性,客觀呈現受測系統在約定測試條件下的效能表現。
醫療AI機器人在減輕醫護人員行政與重複性工作負擔上,可扮演重要角色。然而,醫療資訊的準確性攸關病患安全,需避免生成缺乏資料依據的內容。 AI生成內容是否具有明確依據及可追溯來源,亦是系統評估的重要環節。本次測試計畫在分類效能量測部分參考ISO/IEC TS 4213:2022相關方法,並依受測系統的功能及應用特性,在資訊檢索、回答品質及高風險問題辨識等項目進行測試。
根據德國萊因TÜV的測試評估報告,受測系統的主要測試結果如下:
- 資料檢索表現: 測試結果顯示,在本次包含疾病、手術、檢查、藥物及照護流程等類別中,系統檢索命中率皆為100%,顯示愛寶系統能從語意角度精準命中既有的醫院資料庫內容,提升回答內容與既有醫療資料的對應程度。
- 回答品質: 在衛教實測中,系統在內容正確性、檢索內容支持度及問題相關性三項指標上完成測試,所得出的衛教回答正確性與忠實度達99.9%。少數未達滿分的案例,主要因回答補充了檢索資料未直接記載的一般醫學知識,而非內容本身存在醫學錯誤,反映此次測試採取較嚴格標準來評估來源忠實性及可追溯性。
- 高風險問題辨識表現: 針對越權要求、提示注入等企圖誘騙AI的資安風險,以及涉及自傷、傷害他人等高風險提問,愛寶的分類指標達到100% ,未出現誤判分類。
長聯科技董事長李友錚說明:「醫療資訊攸關病患安全,回答不能容許無中生有。因此,愛寶主動接受第三方測試,確認系統的可靠性;有別於採用雲端大型語言模型的作法,愛寶採用地端自建語言模型,兼顧醫療場域對安全與資訊隱私的要求。」
德國萊因TÜV工業服務與資訊安全服務總經理劉緯強表示,獨立第三方測試以明確的範圍、方法及條件為基礎,客觀呈現受測系統於指定版本與測試條件下的效能表現,不僅有助AI開發商掌握系統現況並持續最佳化,也可為醫療機構評估AI應用提供參考。
長聯科技將於2026年8月19日至22日參加在南港展覽館舉行的「台北國際自動化工業大展」,並於產發署展位(M634)展示搭載本次受測AI衛教生成模組的愛寶機器人及相關測試成果,期望藉此提升業界對醫療AI風險管理、資訊透明度與來源可追溯性的重視。
展會期間,德國萊因TÜV亦將於J326展位提供機器人安全、AI效能評估及資安合規相關諮詢,從測試評估到實際應用,協助業界進一步掌握AI與機器人技術導入所涉及的安全與合規議題。此外,近期將發表智動未來:機器人安全驗證與資安合規白皮書,敬請關注相關發表資訊。