市場熱潮之下,我們如何在高合規工作場景驗證 Agent
生成式 AI 普及後,很多人都用它整理資料、寫文章或修改郵件。第一稿看來完整,核對後卻可能發現數字、引文或事實有誤;逐項改正後,再要求縮短篇幅或調整語氣,下一版又可能改動已確認的內容,甚至讓舊錯誤重新出現。個人使用時,這些情況通常只會令人多花一點時間核對和重改。
問題進入企業場景後,影響便不同了。內容是否符合來源,關乎準確性;多輪處理後能否保留已確認的版本,關乎穩定性。當 AI Agent 開始查系統、填表、建單、發信和推進流程,錯誤可能直接進入企業運作,版本漂移也可能令批准內容與最後執行的內容不一致。這正是 Agentic Workflow(具代理判斷能力的工作流)成為市場焦點的原因:AI 不只要完成任務,還要在核查、版本、權限和責任邊界內穩定運作。
準確性和穩定性成為交付條件後,企業關注的自然不再只是 AI「會不會聊天」,而是「能不能持續把工作做好」。Stanford HAI 的《2026 AI Index Report》顯示,88% 受訪者表示其組織至少在一項業務功能中使用 AI;領先的 agent 在 OSWorld 電腦任務測試的成功率已由早期約 12% 升至約 66%,但目前最佳系統仍大約每三次失敗一次。能力進步很快,但距離穩定承擔企業工作仍有一段路要走。
筆者綜合多家平台的公開文檔(如 Microsoft Copilot Studio、OpenAI Presence 及阿里雲百煉)後觀察到,agent、工作流(workflow,按既定步驟運行的流程)、知識庫、API、工具、重試和異常處理正被放進同一套編排環境,可見產品的發展方向正在彼此靠近。這是清楚的市場訊號,但仍未等於企業部署已經成熟。產品展示(demo)通常談能力,企業最後要處理的是成本、權限、責任、可靠性,以及出錯後如何收拾。

市場共識正在形成
第一,AI 正由生成內容走向完成任務。早期企業 AI 多數用來寫初稿、摘要、翻譯和整理會議紀錄。Agent 再多走一步:接受目標、拆解步驟、選擇工具、取得數據,按中間結果調整下一步。市場競爭因而由「文字寫得好不好」延伸至「任務有沒有做完」。
第二,工作流沒有退場。Agent 擅長處理模糊輸入和例外情況;工作流則保證必要步驟、規則、權限及紀錄不被遺漏。以品牌風險管理和政務輿情簡報為例,agent 可以閱讀新聞、社交內容、調研結果和部門附件,識別議題、抽取數字、核對本地名稱,再形成摘要或初稿;來源檢查、風險分級、指定人員覆核、任務分派和正式歸檔等,交給已測試的流程通常更穩。實際架構既可以由工作流在需要理解和判斷時調用 agent,也可以由 agent 調用已驗證的工作流完成送審、分派及留痕。
第三,人仍在流程中,也就是「人在迴路」(Human-in-the-Loop, HITL)。低風險、可逆的工作可以自動完成;而涉及金錢、政策、合約或個人權益時,AI 可以準備材料和建議,決定由指定人員作出。人工覆核也不能只加一個「批准」按鈕便了事。審批人需要看到來源、版本、風險和執行紀錄,才有條件承擔判斷。歐盟 AI Act 的風險分級框架,也把活動日誌、可追溯性和適當人工監督列為高風險系統的重要要求。
第四,模型以外的能力決定 AI 能否進入生產。知識、工具、權限、日誌、版本、重試、回退、人工接管和持續評測,任何一項欠缺,都可能令一個漂亮的演示停在會議室裡。NIST 在 2026 年啟動關鍵基礎設施可信 AI 專項工作,仍然以可重複、覆蓋完整生命週期的風險管理為主線。Stanford HAI 同年的資料則顯示,已記錄的 AI 事故由 2024 年的 233 宗增至 2025 年的 362 宗,可見負責任 AI 的評測和披露仍追不上能力發展的速度。

我們走過的 AI 產品路徑
筆者團隊的 AI 產品進化路徑,與上述方向大致一致,起點卻有明顯不同。多年累積的調研、數據分析、社交聆聽和專業洞察報告交付能力,構成了這條路徑的起點。不同產品和服務表面各自獨立,底下共享同一套工作流:收集數據、判斷來源、理解本地語境、形成洞察,再把成果帶入決策和行動。
這些能力後來逐步匯入一個企業級工作平台,讓政府和企業把輿情分析和市場情報、調研互動、內容生成、審批及任務執行接成同一條工作流程,並以「聆聽、互動、生成、行動」組織工作。再往下一層,我們建立共用的Agentic AI 底座,把模型路由、知識調用、可重用技能(skill)、工具、任務編排、權限、日誌和人工覆核接在一起。
我們目前把能力分成三個工作層面。第一個層面是已經可以正式交付的標準功能,例如寫作、翻譯、摘要、文字辨識和語音轉文字。第二個層面是要與客戶共同設計的場景,例如接入客戶自己的知識庫、身份系統、審批流程或內部軟件。第三個層面集中處理 AI 治理、責任與邊界控制,包括誰可以使用甚麼數據、哪些行動需要批准、如何留痕,以及出現例外時由誰接手。
三個層面分別處理標準任務、客戶場景和治理控制,同一項目往往會同時用到。把這條界線說清楚,比在簡報上畫一條華麗的升級路線更重要。
這段經驗給了我們一個認知上修正的機會:Agent 自主程度與組織治理程度是兩條軸。治理要求很高的平台,未必需要高度自主;一個能自行選工具、跨系統操作的 agent,也可能欠缺身份、審計和責任邊界。
我們做對了甚麼,又帶來哪些創新
回頭看,我們做對了三件事。第一,沒有把模型當作產品的全部,而是由數據、研究方法、本地語境和真實工作流程出發。模型可以更換,但客戶累積下來的知識、規則、模板和審閱標準則要留在系統裡。
第二,我們把 agent、可重用技能和工具調用放在共用底座,讓不同項目按需要組合知識、工具、流程與治理能力,毋須每次由零開始重建。
第三,我們把前線項目同時視為交付和產品驗證。項目除了完成客戶工作,也要驗證哪些方法可以標準化,哪些規則只能留在特定場景中,避免把一次性的定制誤當成通用能力。
以創新方法論推動項目走向可信、可驗收
我們近期完成了一個高合規的智能政務助手實驗項目,任務是根據部門附件生成可送審的正式文本,使用者需要核對數據、證據、文件種類、格式和最終文件。我們以同一組 15 宗任務及附件,分別測試基線版和改良版。按相同的任務、證據及格式準則評分,平均質量分由 62.9 升至 77.5;內容、證據和格式全部合格的任務由 4 宗增至 11 宗,即端到端通過率由 26.7% 升至 73.3%。15 宗任務均能生成指定正式文件,但完成交付不代表內容合格;按項目既定口徑記錄的關鍵質量問題亦由 23 項降至 7 項。
用戶體驗層面採用配對 A/B 測試。我們在相同任務、附件和交付要求下,同屏並列展示兩個版本,讓實際用戶比較內容是否清楚、自然、可信、符合工作需要,以及是否願意採用。部分測試亦直接比較「不調用本地知識庫」與「調用本地知識庫」的結果,觀察正式名稱、政策規則、部門用語、模板和證據邊界能否帶來可辨識的改善。
這種測試比純技術基準更接近本項目的交付要求,但用途不同,不能直接比較優劣。Kapoor 等人的獨立研究也指出,現有 agent 基準測試過度集中於準確率,經常忽略成本、可重現性及下游場景是否真正適用。我們的測試同時檢查技術表現、用戶評價和正式交付,結論很令人鼓舞。
測試亦顯示,改善來自任務規格、數據邊界、本地知識、核查規則、固定測試和人工反饋。單靠修改提示詞(prompt)或更換模型,很難穩定地重現同樣結果。
以前完成一個項目,留下的是報告和文件。現在還要留下可合法重用的數據結構、知識、模板、規則、可重用技能、工作流、測試及驗收證據。這些資產讓下一個項目毋須由零開始,也把知識與驗收標準留在組織內。少了這一步,定制項目做得越多,技術債通常也越多。
市場最常見的誤區
第一個誤區,是把 agent 當作可以獨立工作的「數碼員工」。員工有職責、授權、經驗和法律責任;Agent 是模型、數據、提示詞、工具及權限組成的軟件系統。它可以執行任務,但不能自行承擔後果。
更麻煩的是,agent 不一定用報錯方式顯示失敗。它可能引用錯誤版本、誤解政策、重複提交操作,或在缺少證據時補上一段很順口的內容。系統表面完成了任務,錯誤卻悄悄進入下一個環節。
第二個誤區,是把 copilot 視為最終形態,或者反過來認為它已經過時。政策分析、法律意見、策略選擇和創意發展,本來就需要人反覆追問、比較和取捨,copilot(由人主導的 AI 助手)仍有明確的價值。當然,它的限制也很明顯。如果員工仍要自行找文件、複製數據、逐句下指令,再把結果貼回幾個系統,AI 只加快了眼前的一小段工作,沒有改變任務的整體流轉。
第三個誤區,是以為 agent 愈多,系統便愈成熟。每增加一個 agent,便增加溝通、延遲、成本和錯誤傳遞。若一個 agent 配合兩個已驗證的工作流已能完成任務,沒有必要另組一個虛擬的董事局來開會做決策。
第四個誤區,是把企業採用畫成「copilot、工作流、agent」的直線階梯圖。自動整理公開新聞可以提高自主程度;涉及福利資格或合約審批,即使用同一模型,也要保留指定人員執行批准任務。企業要按任務風險、數據敏感度和責任要求選擇最優組合。
第五個誤區,是把「AI 會取代哪些崗位」當成最小的單元。現實中,一個崗位通常包含數據整理、初稿製作、專業判斷、溝通協調、審批及承擔責任等多項職責。Stanford HAI 轉述的 2025 年 McKinsey 調查顯示,約三分之一受訪者預期所在組織未來一年會因 AI 減少人手;報告同時指出,整體就業數據尚未顯示廣泛而一致的職位流失。未來較可能先出現的情況,是AI 逐步嵌入部分職責和工作單元:接手高頻整理、檢索、生成和核查,再由人處理例外、授權、取捨及最終責任。企業軟件也會由管理職位和流程,走向動態分配每一項任務,是由人、agent 還是固定工作流來完成。
企業軟件正在變成任務治理系統
傳統的流程型軟件即服務(Software as a Service, SaaS)主要記錄由誰處理任務,以及工作進入哪個階段。加入 agent 後,系統還要決定此刻由人、AI 還是固定流程執行;Agent 可以讀取哪些數據、採取哪些行動;甚麼情況需要批准;如何證明任務完成;失敗後怎樣復原。
企業的 AI 評分卡也要更換。帳號數、登入率和模型調用量(token)只能反映工作活動情況。更實際的指標包括任務完成率、首次通過率、人工接手率、處理時間、返工量、每項成功任務的總成本,以及任務完成後留下多少可重用的資產。我們在項目中看到,人工核對、錯誤重跑、格式修補和跨部門溝通,經常比 token 單價更影響總成本。
未來兩三年,市場會爭六件事
第一是agent 身份和最小權限。企業要知道每一個 agent 代表誰行動、可以讀甚麼、可以修改甚麼,以及權限何時失效。它需要獨立身份、授權範圍、操作日誌和緊急停用機制,不能共用一個權限過大的系統帳號。歐盟和 NIST 在 2026 年的治理方向,都把可追溯、人工監督和完整生命週期風險管理推到更實際的位置。
第二是持續評測。政策、數據、模型和用戶行為都會變,上線時通過測試,不代表三個月後仍然可靠。企業需要固定測試集、真實失敗案例、版本對照、回歸重跑和小範圍發布;表現退化時,還要能回退到上一個可靠版本。Stanford HAI 所記錄的事故增長與評測缺口,說明評測不能只在上線前做一次。
第三是模型可替換。同一個模型未必同時適合高風險判斷、大批量摘要、本地部署和低成本任務,平台要能按準確度、速度、價格、數據駐留及權限要求選擇模型。企業自己的知識、流程、測試、權限和歷史紀錄應留在組織手上;更換模型時,工作方法不必重新開始。
第四是產品護城河。只在通用大型語言模型(LLM)外面加一層介面和提示詞,卻沒有專有數據、工作流程、治理控制及持續評測的純套殼產品,很容易被模型供應商或大型平台吸收。能夠沉澱行業知識、客戶規則、審批、測試和交付責任的產品,才有機會建立自己的工作系統。
第五是任務經濟。市場會少問建了多少個 agent,而多問每完成一項合格任務花多少錢。總成本不能只計 token,還要加入人工覆核、失敗重跑、系統接入和維護。企業採購 AI 時,也會由比較功能及帳號價格,逐步轉向比較每項任務的完成率、錯誤成本和人工接手比例。
第六是商業模式。收費方式可能由帳號與用量,逐步加入任務完成、採用率、節省工時或業務結果。這會迫使供應商與客戶先說清楚基準、計算方法、數據來源和責任邊界;否則,平台很難證明成效究竟來自 AI、流程改善,還是人員額外投入。沒有可信評測,成效收費只會變成另一種市場口號。
Agent 要接手更多企業工作,來源、操作紀錄、批准條件和責任人便要留在同一條流程裡。少了其中一項,完成任務也不等於可以交付。 這是我們的實戰經驗。
參考文獻
European Commission. (2026, August 3). AI Act. https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai
European Parliament & Council of the European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence. https://eur-lex.europa.eu/legal-content/EN/TXT/?uri\=CELEX:32024R1689
Kapoor, S., Stroebl, B., Siegel, Z. S., Nadgir, N., & Narayanan, A. (2024). AI agents that matter. arXiv. https://doi.org/10.48550/arXiv.2407.01502
Microsoft. (2026, April 10). Automate business processes with agents plus workflows in Microsoft Copilot Studio. https://www.microsoft.com/en-us/microsoft-copilot/blog/copilot-studio/automate-business-processes-with-agents-plus-workflows-in-microsoft-copilot-studio/
National Institute of Standards and Technology. (2026, April 7). Concept note: AI RMF profile on trustworthy AI in critical infrastructure. https://www.nist.gov/programs-projects/concept-note-ai-rmf-profile-trustworthy-ai-critical-infrastructure
OpenAI. (2026, July 22). Introducing OpenAI Presence. https://openai.com/index/introducing-openai-presence/
Stanford Institute for Human-Centered Artificial Intelligence. (2026). The 2026 AI Index report. https://hai.stanford.edu/assets/files/ai\_index\_report\_2026.pdf
阿里雲。(2026)。工作流應用。https://help.aliyun.com/zh/model-studio/workflow-application/


