by angus | 2026-09-24
從本地部署到全棧數據治理,政府及企業選擇 AI 方案時還要看甚麼
最近內地接連出現兩宗 AI 數據安全事件。第一宗,用戶原以為請求由正在使用的 AI 產品直接處理,卻未必知道數據可能在背後被轉交至另一家公司的模型。第二宗,使用者在本機安裝 AI 編程工具,工具卻在背景建立整個工作區的快照,並嘗試送上雲端。
在這兩宗事件中,用戶都未曾主動將敏感數據提供給任何第三方,數據卻沿着產品預設的路徑流了出去。
兩宗事件,揭示同一條數據鏈
2026 年 9 月,Anthropic 指部分內地 AI 服務把用戶請求轉交 Claude 處理,再將結果返回原有產品。據《香港01》引述報告,部分請求涉及企業代碼、登錄憑證及政府相關數據;有關指控仍須更多獨立證據核實。
同月,內地多家媒體報導,智譜旗下 AI 編程助手 ZCode 被發現會在背景建立本地工作區快照,並嘗試上傳至外部雲端。事件曝光後,智譜移除相關功能、發佈修正版並開源 ZCode,表示相關數據從未用於模型訓練。
兩宗事件指向同一個採購盲點:界面上的品牌名稱,交代不了完整的數據路徑。供應商可能調用第三方模型、雲服務或分包商,客戶端的預設功能也可能擴大數據流向。機構採購的其實是一整條數據處理鏈,模型或界面只是其中一環。
管好內部使用,還要看供應商
政府部門和企業近來都在訂立 AI 使用守則:哪些文件不能上傳、哪些數據要先刪去身份信息、哪些工作要由主管批准,規定愈來愈仔細。內部人員管住了,下一個問題便是:供應商在後台怎樣處理數據,機構看得見嗎?
當前,不少 AI 使用守則首先規範員工,這一步必須做。供應商一端也要有另一張清單:
產品實際調用哪一個模型?
數據會經過哪些服務器及地區?
系統會否連接第三方接口或分包服務?
供應商的技術人員能否遠程接觸客戶數據?
輸入、輸出及系統日誌會保存多久?
數據會否用於模型訓練或產品改進?
發生事故後,機構能否取得完整紀錄?
這些問題有些要寫進合約,有些要從系統架構、權限設定及日誌中核實。單靠一句「我們重視數據安全」,回答不了。
本地部署也不會自動安全
把 AI 部署在本地,有助收窄數據流動範圍,但不會自動切斷所有外部連接。服務器即使設於自己的機房,系統仍可能連接外網,應用仍可能取得過大的文件權限,模型也可能透過接口調用外部服務。
本地部署主要回答核心系統和數據存在哪裡,其餘環節仍要逐一管控。一套可管理的 AI 環境,至少要控制外部連接,按職責設定數據權限,限定每個應用可調用的知識範圍,為敏感操作加入審批及人工覆核,並保留模型調用、文件存取及輸出日誌。供應商的運維權限也要有範圍、有時限、有紀錄。
採購前,先要一張數據流向圖
機構評估 AI 供應商,不能只比較模型能力或硬件規格,還要同時檢視模型部署、應用開發、權限治理、日誌及持續運維。每一層由誰提供、由誰負責、出事時由誰追查,都要事先寫清楚。層與層之間一旦留白,發生數據事故時便難以釐清責任。
機構可以在採購前要求供應商畫出一張完整的數據流向圖:數據從哪裡進入、經過哪些模型和服務器、誰能接觸、保存多久,以及每一步留下甚麼紀錄。能把這張圖交代清楚,機構才有足夠依據判斷供應商是否可信。
協作者:張Sir與AI
參考資料
香港01。(2026年9月12日)。〈Anthropic指中國AI公司蒸餾攻擊 敏感資料也送交 北京反駁報告〉 。
財新網。(2026年9月21日)。〈智譜被指未經用戶允許上傳數據 隨後致歉並開源ZCode〉 。
第一財經。(2026年9月21日)。〈智譜完成ZCode開源並整改,承諾相關代碼數據未用於模型訓練〉 。
36氪。(2026年9月20日)。〈智譜ZCode傳包風波,那些沒回答的事〉 。
by angus | 2026-09-23
只做判斷、不寫文字的 AI,換題不用重新訓練,答錯了仍要靠人發現
二十多年前,張Sir和團隊開始做內容分析、數據挖掘和輿情分析。研究員先寫好一本編碼簿(codebook,列明每個類目怎樣定義、怎樣判斷的手冊),編碼員對着一疊疊新聞,逐篇回答同一組問題:這篇報道講哪個議題,對涉及的某政府部門是正面、中立還是負面,要不要列入當日重點。答案早就列好,只能選,不能自由發揮。
後來數據多了,人手追不上,便改用機器學習。意圖分類、風險評分、情感分析,做法大同小異。先人工標註幾千條樣本,訓練一個模型,數據丟進去,分個類、打個分數、算個機率,把握大的自動處理,把握小的由人複核。這類分類器在大語言模型出現之前已經遍地都是,在自家服務器上就能跑,毋須上雲。
所以最近看到 Jev 在開發者圈子突然走紅,張Sir第一個反應是有點疑惑,這個概念不是很久以前就有了嗎?近幾年 AI 行業的技術和營銷越來越難分開看,一樣東西走紅,未必等於它是新東西。細看下去,Jev 的做法又確實有幾處跟過去不同。
一個只負責判斷的模型
Jev 是 TypeSafe AI 在2026年9月推出的模型,創辦人 Diogo Almeida 曾在 OpenAI 參與 ChatGPT 背後的研究。官方稱它為 System One Model,名字借自心理學家 Kahneman 對快思考與慢思考的區分。大家熟悉的 GPT、Claude、Gemini 、Deepseek和Kimi等,主要負責生成內容,Jev 不寫文字,只做判斷。一封客服電郵進來,系統要知道的往往只是一個標籤,例如「帳單問題,96%」,然後把信轉給帳務部。Jev 回傳的就是這種東西。
它有三種問法:從幾個選項中選一個,按標準打分,或者判斷一句話成立的機率。每個答案都附一個機率,程序照着決定下一步。有開發者把它形容為一個懂自然語言的 if/switch,也就是程序裡按條件分岔的那幾行語句。官方公佈的速度是每次70至500毫秒,價錢是每百萬輸入 token(模型計算文字量的單位)0.042美元,輸出不收費。
以前難在哪,現在不同在哪
以前做分類,一個任務一個模型。客戶意見分主題、客服信件分流、網上內容審核,這三類張Sir團隊都做了很多年,最花時間的往往不是訓練,是類目一改就要重來。客戶要把一個類目拆細,新議題冒起要加類目,舊類目用久了要合併,這類調整經手過的多不勝數,每一次都要重新標註一批樣本、重新訓練。網上出現一種新的詐騙說法,審核模型也要等新樣本收夠才認得出。
Jev 的做法是在調用時才寫題目和選項。同一個模型,今天用來分客戶意見,明天用來判斷一條帖文是否涉及詐騙,改幾行文字便可以,這一點最值得看。不過這個做法並非 Jev 首創。2019年前後已有零樣本分類(zero-shot classification,不用預先標註、調用時才告訴模型有哪些類別),大語言模型面世後,用提示詞叫它分類更是常見。
以往的零樣本分類模型快而便宜,理解力有限;換成大語言模型,理解力上去了,速度和價錢又成了問題。Jev 想做的,是讓一個專用模型同時具備自然語言理解、低延遲、機率輸出和低價格。它的理解力和機率是否真的較可靠,目前主要只有官方評測,還要等獨立測試。
Jev 引起開發者注意,也跟 AI 系統的用法在變有關。大語言模型出現後,大家一度習慣甚麼都丟給大模型;現在開始有人回頭想,單純的分類、判斷和路由(決定任務由誰處理),也許可以交給更專門、成本更低的模型。AI Agent(能自行分步完成任務的 AI)的流程裡,充滿這類小判斷:下一步用哪個工具,這個結果要不要再查,任務該由哪個模型處理。每一個都叫通用大模型來判斷,往往較慢,也較貴。比較合理的分工,是由 Jev 做分類和判斷,理解、推理和寫作仍由大模型負責,動作則由程序執行。
有了機率,分工便有依據。機率高的自動執行,中等的再由大模型判斷,低的轉人工處理。以前團隊也按機率分流,只是在一個模型內部分;現在分流的對象,變成了不同的模型和人。
開源項目 fast-jev-compaction 示範了另一種用法。它讓 Jev 替寫代碼的 AI 助手清理記憶,逐條判斷舊的工具調用和結果還要不要,過時的刪走或截短,留下的一字不改。以往這一步多數由大模型寫摘要,容易漏掉檔案路徑、錯誤訊息這類細節。Jev 不用寫,只判斷甚麼該留、甚麼可以忘。這也帶出一個問題:AI 每一次真的都需要生成文字嗎?
優點和要留神的地方
Jev 快、便宜、輸出格式固定,機率可以直接用來設定自動化的門檻,前提是門檻先用自己的數據驗證過。它的限制同樣要看清楚。Jev 不寫文章、不作解釋,答案範圍要預先定好,題目寫得含糊,結果也會含糊。官方把「不會幻覺」界定為不會產生預設選項以外的答案;答案落在選項之內,選錯仍然可能。做輿情的人都知道,把一條負面帖判成中立,比格式出錯麻煩得多,因為表面上看不出問題。
官方公佈的數字也要打個折扣,首頁那句「快193.6倍、省444.6倍」出自自家設計的測試,官方也承認屬偏高一端;答對與否,是跟兩個大模型的平均答案比,並非由專家核定。完整的模型架構、參數規模、訓練細節和可重現的論文,至今都未公開。繁體中文、粵語和中英夾雜的表現,截至截稿,也未見公開評測。
這幾年 AI 新名詞太多,一個東西剛出來就被捧成未來,過一陣子大家又集體遺忘。所以張Sir現在習慣先等一下,看它解決了哪些以前很難解決的問題,還是把以前就有的東西,用新一代 AI 的方式重做一次。以目前公開的資料,下結論還太早。
檢驗這類模型,可以借用內容分析的老方法
在獨立評測出來之前,機構可以先自己測。換題變得容易,題目出得好不好就更要緊,類目要互斥、要窮盡、邊界要清楚,這是編碼簿的基本功。判斷準不準,要拿人工編碼作標準答案。兩位受過訓練的編碼員先各自判斷同一批樣本,計算彼此的一致程度(業內稱為編碼員間信度);達到要求後,分歧的個案再經討論或由第三人裁決,得出一套人工確認的標準答案(業內稱為金標準),最後拿模型的答案來比較。近日有人 拿 Jev 跟大模型分揀同一批新聞,兩邊結果九成四一致,便說 Jev 好用;可是兩邊都沒有跟人工答案核對過,一致不等於正確。
學術界和市場使用內容分析這套方法已有幾十年,工具也現成。有興趣的讀者可參考DiVoMiner 平台,它同時支援人工編碼、AI 編碼和信度測試,不少知名高校的師生都在用。在 Google Scholar 上,可以檢索到不少以它做內容分析的論文,當中不乏 SSCI(社會科學引文索引)期刊。
例如 Chang 等人(2021)比較了內地、香港和台灣十年間三萬多篇中文新聞;Law 等人(2025)收集香港親子論壇 Baby-Kingdom 上一萬七千多條有關中醫的留言,按八個主題的編碼簿,在平台上做情感和語義網絡分析;Zhang 等人(2023)分析網上醫患對話,兩位編碼員在平台上獨立編碼一百段樣本,信度係數達0.86(1代表完全一致)。
同樣的方法也可以核對模型給出的機率。模型說有九成把握的那批答案,實際答對多少,要用本地樣本算過才知道,廠商的整體數字不能直接沿用;類目一改,又要重算一次。繁中、粵語和中英夾雜的本地語料,正是 Jev 還沒有公開評測的部分,用在本地場景之前,這一步省不得。哪些數據可以送出機構做測試,也要先按敏感程度分清楚。
本地知識有多重要,團隊做過一次內部實驗,張Sir在〈當 AI 從個人助手走進企業工作 〉介紹過。同一組15宗政務寫作任務,改良版的平均質量分由62.9升至77.5,並由實際用戶並排比較兩個版本。改善主要來自清楚的任務要求、本地知識和人工反饋,單靠換模型做不出來。那次測的是寫作,判斷類的任務,相信道理也相通。
類目用久了也會過期,公司部門改名、新議題冒起,編碼簿和測試樣本都要有人定期更新;模型換了新版本,舊的門檻也要重測。〈政府公文 AI 的第 90 天 〉一文談的正是這件事。
Jev 值得一試,試的時候拿自己的數據,挑幾道常見的判斷題,跟人工的答案對一次,心裡便有數。
協作者:張Sir和AI
延伸閱讀:團隊的 TI(Trusted Intelligent)系列 ,信得過的 AI 應用方案。
參考資料
張Sir(2026年8月21日)。當 AI 從個人助手走進企業工作。張Sir的AI養生館。https://www.anguscheong.net/2026/08/21/ai-agent-enterprise-work/
張Sir(2026年9月2日)。政府公文 AI 的第 90 天。張Sir的AI養生館。https://www.anguscheong.net/2026/09/02/government-document-ai-day-90/
Almeida, D. (2026, September 15). Introducing System One models & Jev . TypeSafe AI. https://typesafe.ai/blog/introducing-system-one-models-and-jev
Chang, A., Schulz, P. J., Jiao, W., & Liu, M. T. (2021). Obesity-related communication in digital Chinese news from Mainland China, Hong Kong, and Taiwan: Automated content analysis. JMIR Public Health and Surveillance, 7 (11), e26660. https://doi.org/10.2196/26660
Law, M., Ho, K. H., & Cui, X. (2025). Exploring Hong Kong public attitudes and concerns about traditional Chinese medical treatments: A study on discussion forum responses. International Journal of Pharmaceutical and Healthcare Marketing, 19 (3). https://doi.org/10.1108/IJPHM-05-2024-0039
Tran, T. (2026). fast-jev-compaction \[Computer software]. GitHub. https://github.com/tamaratran/fast-jev-compaction
Zhang, W., Zhou, F., & Fei, Y. (2023). Repetitions in online doctor–patient communication: Frequency, functions, and reasons. Patient Education and Counseling, 107 , 107565. https://doi.org/10.1016/j.pec.2022.11.007
by angus | 2026-09-02
頭三個月好用是應該的,往後撐不撐得住,要看人在迴路的兩個崗位
近日,鄰近地區有兩宗政務 AI 的公開消息。
一宗來自某地方政府。當地每月產出約一萬份公文,熟手處理一份最快要二十分鐘,導入公文智能系統後縮短至兩分鐘,二十三個局處全面啟用。系統先以五千份公文建立評測基線,再從近五年的歷史文件中篩選兩萬份作為素材(按此閱讀報道 )。
另一宗來自另一個地區。當地政府把經技術審查、適用於政務場景的 AI 方案編成目錄,超過二百六十項,涵蓋文本摘要、自動翻譯、數據分析和公文輔助寫作,同時發布部門應用指南,並為公務人員安排過百項數字科技培訓(按此閱讀原文 )。
兩則消息的數字都很亮麗,重點落在系統啟用、方案供給和培訓規模。第一宗經過半年試用,報道交代了公文製成時間由二十分鐘縮短至兩分鐘,卻沒有提到錯誤率、初稿要改幾次、人工重做多少,或者哪些部門仍在持續使用。這些數字較難看,也更能說明系統過了第 90 天之後的表現。
筆者團隊正在做的公務智能平台項目裡,這段變化見過不止一次。頭一個月的數據好看到不用解釋,到了第三個月,同事和用戶談論系統的方式會慢慢改變。
導入初期的好感,來自格式複現
公文寫作有相當一部分工作是格式複現。稱謂、行文套語、段落結構、行政邏輯、前例參照都有既定做法。把歷史公文整理成可供查找的檢索庫,讓系統按情境調出相近舊件,再據此起草,通常會有不錯的效果。業界稱這種做法為檢索增強生成(retrieval-augmented generation, RAG),系統先找出相關內容,再拿來生成答案。
原本二十分鐘的例行公文,兩分鐘便有初稿,這個落差足以令任何部門在頭一兩個月感到好用。格式複現是 RAG 擅長的工作,處理得好,確實能省下大量時間。麻煩往往在之後出現。
好感怎樣在三個月內改變
用戶對新系統的評價通常會隨時間變化。傳播學與信息系統研究分別解釋過其中幾種現象,把它們放回同一段使用歷程,便能看見評價如何改變。
初期先有新奇效應(novelty effect) 。新工具因為新鮮,往往得到較高評價和使用率;人熟悉之後,這部分好感會逐漸淡去。多數系統的宣傳材料,採用的正是這一段數字。
接着出現期望不確認(expectation disconfirmation) 。用戶是否滿意,會受實際表現與事前期望的差距影響。二十分鐘縮短至兩分鐘後,兩分鐘很快變成日常,省下的時間不再顯眼,剩下的錯誤卻愈來愈礙眼。
剛開始,系統處理的多是高頻、格式化公文。這一批做完後,留下的長尾案例難度較高,整體準確率可能隨之下降。用戶未必會把原因拆開來看,他們感受到的是系統好像退步了。
幾次錯誤之後,算法厭惡(algorithm aversion) 便可能出現。研究發現,人看到算法出錯後,放棄它的速度遠快於看到人出錯後放棄那個人,即使算法整體表現較好。公文系統只要幾次引用過期職銜或已廢止條文,便足以損害一個部門的信任。用戶很少逐類判斷哪些任務做得好,往往把折扣算在整套系統身上。
按筆者團隊在開發政務AI平台中的觀察,模型換得快,用戶的習慣也定得快。拿第一個月的表現推算第三個月,誤差可以很大。
歷史公文會過期,檢索和微調都認不出來
用戶評價改變時,歷史公文也在悄悄過期。五年文件裡可能有已廢止的法規條文、改組前的部門名稱、已離任人員的職銜和停辦計劃。單純按相似度檢索的系統,分得出哪一份寫得最像,分不出哪一份今天仍然有效。
系統找出一份舊公文,格式齊整,語氣也得體,引用的卻是三年前的組織架構。這種錯很難揪出來,因為整份文件讀起來十分正常。承辦人員若不熟悉相關領域,簽出去前未必察覺,等到有人指出,文件可能已經對外發布。
市面上常見兩種處理方法。第一種是前文提到的 RAG,把歷史文件整批放進檢索庫,讓系統按相似度尋找,再把找到的內容交給模型生成公文。它起步快、成本低,短期效果也容易看見;限制是相似度只管像不像,不會判斷文件今天是否仍然生效。愈是寫得標準的舊公文,系統愈容易把它找出來。
第二種拿歷史公文再訓練模型,讓模型學會當中的行文習慣,業界稱為微調(fine-tuning)。微調有助掌握格式、語感和文種,過期內容也可能一併進入模型,而且清理起來比檢索庫麻煩。檢索庫刪除一條,當天便能生效;已經練進模型的舊職銜,通常要重新訓練,仍未必清得乾淨。
換一個更大的模型也補不上這個缺口,因為沒有人告訴系統哪一條已經作廢。採用檢索還是微調,在這裡只是技術選擇;數據狀態有沒有人持續維護、維護得有多細,才會逐步拉開系統的準確性和穩定性。演示(demo)和概念驗證(POC)使用的多是現行文件,答案清楚,這個差距不易暴露。到了第 90 天,它才慢慢浮上來。
人在迴路的兩個崗位
以上兩種退化各要有人接住。業界統稱這種安排為人在迴路(human-in-the-loop, HITL),意思是在要緊關口保留人的判斷,由人決定輸出能否繼續往下走。多數人談 HITL,會把它理解成合規覆核,像在文件上蓋一個章。張Sir認為,這個迴路需要兩個崗位,處理兩類不同問題。
用戶端的人。 承辦人員可以改稿,審批人也能看見生成依據。研究算法厭惡的學者後來再做實驗,發現只要容許用戶稍微修改算法輸出,他們便較願意繼續使用一套會出錯的算法。覆核除了把關,也有助維持採納率。一套只交出最終答案、不讓承辦人員插手的系統,出錯後較難挽回;把改稿權留給人,系統才有機會在錯誤之後重新取得信任。
平台端的人。 數據狀態要有人維護,包括哪一條現行、哪一條已撤銷、哪個部門改了名、哪個職銜換了人。這項工作要按週期進行,做得再好也很少有人看見,卻會決定系統到了第二年是否仍然準確。
平台端這個崗位,多數科技廠商不會替公務人員承擔。合約一般涵蓋系統交付、功能開發和技術支援,數據由誰更新、多久更新一次、更新到甚麼程度才算合格,往往沒有寫清楚。系統上線時,這個崗位可能仍然空着,代價要過一段時間才會出現。
用戶端的人隨件出現,一份公文擺到面前,他改一改,決定簽還是不簽。平台端的人不對着公文,他對着數據,每隔一段時間清理過期內容。少了前一個,系統出錯後容易失去用戶;少了後一個,系統會愈用愈舊,而且舊得無聲無息。
第 90 天要看的六項指標
帳號數、開通部門數、登入率和生成份數,反映的是有沒有人點過系統。要知道這套系統是否值得繼續投入,可以換一組數字來看。
任務完成率 ,交出去的內容有多少真的能用
首次通過率 ,初稿一次過關的比例
人工接手率 ,有多少任務最後仍要人手重做
返工量 ,平均改多少輪才定稿
每項成功任務的總成本 ,把人工核對、錯誤重跑、格式修補和跨部門溝通一併計算
可重用資產 ,核准表述、模板、規則和失敗案例有沒有留下來
在筆者團隊正在做的公務智能平台項目裡,導入 90 天後,前四項往往比帳號數和生成份數更能反映實際使用情況。最後一項最容易被忽略,它會影響同一筆投入到了第二年還能留下多少價值。
看完這六項,還可以追問一句:「上線 90 天之後的數字,公布過沒有?」這組數字現在仍然少見,多數 AI 產品宣傳停在開通部門、生成份數和節省時間。
公文要簽署、要負責、要備查,這幾件事不會因為初稿改由 AI 起草而消失。系統能陪一個部門走多遠,仍要看兩個崗位有沒有人一直站着:一個守住每份文件,另一個守住系統每天使用的數據。
協作者:張Sir和AI
參考資料
Dietvorst, B. J., Simmons, J. P., & Massey, C. (2015). Algorithm aversion: People erroneously avoid algorithms after seeing them err. Journal of Experimental Psychology: General, 144 (1), 114–126. https://doi.org/10.1037/xge0000033
Dietvorst, B. J., Simmons, J. P., & Massey, C. (2018). Overcoming algorithm aversion: People will use imperfect algorithms if they can (even slightly) modify them. Management Science, 64 (3), 1155–1170. https://doi.org/10.1287/mnsc.2016.2643
Oliver, R. L. (1980). A cognitive model of the antecedents and consequences of satisfaction decisions. Journal of Marketing Research, 17 (4), 460–469. https://doi.org/10.2307/3150499
by angus | 2026-08-21
科技戰略,為何要回到課室與工坊
最近讀到美國白宮科技政策辦公室(Office of Science and Technology Policy, OSTP)2026 年 7 月發表的《科學:一個新黃金時代》(Science: A New Golden Age )。報告鋪陳人工智能(AI)、聚變、量子、半導體、機器人和太空等題目,都是人們談科技戰略時最熟悉的主角。
讀到第四章,焦點忽然轉到社區學院(community colleges)、工坊、學徒制和技術證照。這些名詞沒有 AI 和量子那樣搶眼,卻關乎整份報告能否落到實處。新技術要由研究走到生產,靠的不是一句「加快轉化」;儀器要有人操作,原型要有人做,系統要有人維護,研究流程也要有人跑穩。
報告分別提出強化實作訓練、社區學院、學徒制和區域生態系的連結。職業教育在這裡並非陪襯。科技工作本來就有兩種功夫,一種是提出問題,另一種是把事情做成。
研究有研究的節奏,製造有製造的規矩。由想法走到成品,中間少不了懂設備、懂流程、肯落手的人。
AI 時代的科研、訓練與產業現場,不能各自運作。
課堂以外的學習,怎樣算數
報告提出,大學和社區學院的科學、技術、工程與數學(STEM)課程,可加入實務技術訓練和業界實習(externships),並讓實作經驗、產業證照計入學位。它還把認證、招生和教師升等一併放進改革範圍,意思很清楚:學校評人,除了論文,也應看他有沒有做出可用的技術工作。
這個方向不算新,難在大學向來不太擅長承認校園以外的學習。有人已在工廠、實驗室或工程現場累積真功夫,回到學校卻要由頭再來;有些教師長期幫企業解難,評價時卻不及多發幾篇論文。制度只認一種履歷,很多可用的人便留在門外。
若能把機械加工證書、實驗技術員資格和先進製造學徒經歷,做成可逐級累積的資格,人便可以先靠一門手藝入行,再往更高階的知識和職責走。這也逼大學重新想一想,自己在人才培養裡應站在哪一個位置。
大學的圍牆,該開幾扇門
報告沒有要大學和博士教育退場,反而明說大學仍是訓練科學家、處理基礎問題的重要場所。只是前沿設備、專業工程能力和職涯機會愈來愈多在校園以外,人才若只能沿著校內的一條階梯往上爬,整個體系便會愈走愈窄。
報告把幾類機構的長處分得很實在。大學實驗室適合好奇心驅動的研究,也適合培養下一代研究者;企業實驗室有固定隊伍和快速反饋,較能處理工程任務;國家實驗室則可維持單一機構難以承擔的大型能力。問題不在誰取代誰,而在彼此之間的門還不夠通。
因此,報告建議讓學界、產業和聯邦研發設施(Federal R&D facilities)之間的人才流動得更順,包括聯合產業或聯邦實驗室博士課程(joint industry or Federal laboratory Ph.D. programs)等跨機構安排。博士生可以在不同組織裡接觸真實問題,也能看見科研在校園以外怎樣運作;大學的課程、實驗室和技術轉移辦公室,也要學會同外部夥伴合作。
早期研究者卡在哪裡
研究生和博士後在科研體系裡很重要,卻常是最缺選擇權的一層人力。項目到期而下一筆資助未批,研究方向就要遷就;想換導師或換機構,資助和履歷又未必跟得上。報告說得直接,冗長的申請、行政工作和短期資助,會把早期研究者推向較穩妥、較容易發表的題目。
報告引用美國國立衛生研究院(National Institutes of Health, NIH)的資料:1980 至 2008 年,主要研究者(principal investigator, PI)的平均年齡由 39 歲升至 51 歲,新任 PI 的平均年齡由 36 歲升至 42 歲。這組數字不能解釋所有學科,卻提醒人們,獨立做研究的門檻正在後移;年輕人還未有機會犯幾次值得犯的錯,已先學會怎樣寫一份不會被拒的申請書。
報告提出,把部分研究獎助(fellowships)直接給學生和研究者,讓資助能跟著人走,不必牢牢綁在某間機構或某位教授身上。這仍是政策建議,並非已落地的全國制度,卻帶出另一個更難回答的問題:大學現時用甚麼標準衡量研究者?
論文一多,麻煩也跟著來
學術界常見一個情況,人人都忙,論文愈來愈多,能改變一個領域的工作卻未必同步增加。原報告把矛頭指向部分終身教職(tenure)和升等誘因。當評價偏向發表數量,研究很自然會被切成較小、較快、較易交差的單位;建工具、做長期資料、報告負結果,這些費時但必要的工作便容易被擠到一旁。
AI 可以大量生成論文、申請和審稿材料,這個問題只會更急。報告提醒,單看論文數、引用數和影響因子(impact factor),科研很容易變成一場數字遊戲,因此提出快速資助、替代性評審試驗、科學的科學(metascience,用科學方法研究科研制度本身),以及較開放的科學傳播做法。
這段對教育界尤其有提醒作用。學生若只學會跟著評分表走,日後研究環境又照同一套邏輯評人,大家最後會很擅長完成指標,卻未必擅長處理難題。科研人才的培養,還包括判斷哪些題目值得花五年、哪些數據不能美化、哪些結果雖然不漂亮仍要如實留下來。這種判斷,也在實驗室的日常工作裡慢慢養成。
實驗室裡,還有誰在做事
美國談科研,常把焦點放在博士、教授和首席研究員身上,這些人當然不可少。不過,一個高水平實驗室裡,還有操作精密儀器的人、處理樣本的人、做原型的人、修設備的人,以及一直守著數據管線的人。
報告提出,可以考慮為熟練技工設立全國性研究獎助,也可讓機械師、技術員等實務人員以駐場實務專家(practitioner-in-residence)身分進入研究環境,並把鄉郊地區的業餘愛好者和創客連接到正式研究機會。
把一件複雜的事做得穩定、可重複、可交接,本身就是科研能力。企業早已明白這個道理,報告把技工和技術員重新放回人才討論裡,後面才談得到學徒制。
學徒制裡,該學甚麼
報告支持把註冊學徒制(registered apprenticeships)延伸到科學和科技崗位,並指示聯邦機關每年達到並超過 100 萬個活躍學徒制名額(active apprenticeships),又提出以招聘與留任表現作為雇主培訓資助的參考。2025 年通過的勞動力佩爾助學金(Workforce Pell Grants),讓短期培訓課程首次符合聯邦助學金資格;社區學院於是可以成為地方技術人才的接口,一頭接企業,一頭接想入行的人。
這比多辦幾個培訓班走得遠。好的學徒制要有清楚的崗位、師傅、技能標準、工資和往上走的通道。學完能不能留下來,能不能由技術員走到更高技能的工作,才看得出計劃有沒有價值,社區學院也因此有了更實在的角色。
一個地方,怎樣把人留住
報告分別主張以區域創新與製造計劃、產業合作和技術培訓建立地方生態系。算力、AI 設施和先進實驗室若只落在少數城市,周邊又沒有培訓和就業安排,地方很難把這些投入轉成持續的技術能力。
報告舉了俄亥俄州的例子。哥倫布一所社區學院帶動 23 所院校組成網絡,共享課程,培養兩年制晶片製造技術員;一家半導體企業投入 5,000 萬美元支持當地高等教育的人才發展。這個個案未必可以照搬,卻說明一點:地方有了製造投資,學校、課程和崗位也要同時準備好。
過去有不少「創新園區」,名字響亮,企業和學校卻各做各的。這一輪會否不同,要看人才問題有沒有在項目起步時已寫進設計。當地需要甚麼工種,誰來教,學完去哪裡做,這些問題若等大樓落成後才問,通常已經遲了。
報告強調,AI 時代的科研進展仍受儀器、設施、製造與技術能力制約。有人把圖紙讀懂、設備調好、流程跑通,研究才有機會走到現實世界。學術研究提供問題、方法和驗證,教育把這些能力交到下一代手上,科創落地則讓知識接受設備、成本、時間和市場的考驗。
眼前沿用已久的安排,往往把科研、教學、實習和業界切成四段,各自有自己的指標和節奏。這套分工在過去有其方便之處,放到 AI 時代,研究和現場互相不了解、學生的學習同真實問題脫節,代價已愈來愈明顯。研究成果要靠懂現場的人驗證,學生要在真實問題裡學會判斷,企業也要把實際困難帶回研究和課堂。三者若能融合互補,科研才不會停在論文裡,教育也不會只留下文憑。如何把科研、教學、實習和業界重新連起來,值得各方思考。
參考資料
White House Office of Science and Technology Policy. (2026, July). Science: A new golden age . https://www.whitehouse.gov/wp-content/uploads/2026/07/Science-A-New-Golden-Age.pdf
by angus | 2026-08-21
市場熱潮之下,我們如何在高合規工作場景驗證 Agent
生成式 AI 普及後,很多人都用它整理資料、寫文章或修改郵件。第一稿看來完整,核對後卻可能發現數字、引文或事實有誤;逐項改正後,再要求縮短篇幅或調整語氣,下一版又可能改動已確認的內容,甚至讓舊錯誤重新出現。個人使用時,這些情況通常只會令人多花一點時間核對和重改。
問題進入企業場景後,影響便不同了。內容是否符合來源,關乎準確性 ;多輪處理後能否保留已確認的版本,關乎穩定性 。當 AI Agent 開始查系統、填表、建單、發信和推進流程,錯誤可能直接進入企業運作,版本漂移也可能令批准內容與最後執行的內容不一致。這正是 Agentic Workflow(具代理判斷能力的工作流)成為市場焦點的原因:AI 不只要完成任務,還要在核查、版本、權限和責任邊界內穩定運作。
準確性和穩定性成為交付條件後,企業關注的自然不再只是 AI「會不會聊天」,而是「能不能持續把工作做好」 。Stanford HAI 的《2026 AI Index Report》顯示,88% 受訪者表示其組織至少在一項業務功能中使用 AI;領先的 agent 在 OSWorld 電腦任務測試的成功率已由早期約 12% 升至約 66% ,但目前最佳系統仍大約每三次失敗一次 。能力進步很快,但距離穩定承擔企業工作仍有一段路要走。
筆者綜合多家平台的公開文檔(如 Microsoft Copilot Studio、OpenAI Presence 及阿里雲百煉)後觀察到,agent、工作流(workflow,按既定步驟運行的流程)、知識庫、API、工具、重試和異常處理正被放進同一套編排環境,可見產品的發展方向正在彼此靠近。這是清楚的市場訊號,但仍未等於企業部署已經成熟。產品展示(demo)通常談能力,企業最後要處理的是成本、權限、責任、可靠性,以及出錯後如何收拾。
AI 由個人問答走進企業工作後,知識、流程、審批和責任要在同一套系統中協作。
市場共識正在形成
第一,AI 正由生成內容走向完成任務。 早期企業 AI 多數用來寫初稿、摘要、翻譯和整理會議紀錄。Agent 再多走一步:接受目標、拆解步驟、選擇工具、取得數據,按中間結果調整下一步。市場競爭因而由「文字寫得好不好」延伸至「任務有沒有做完」。
第二,工作流沒有退場。 Agent 擅長處理模糊輸入和例外情況;工作流則保證必要步驟、規則、權限及紀錄不被遺漏。以品牌風險管理和政務輿情簡報為例,agent 可以閱讀新聞、社交內容、調研結果和部門附件,識別議題、抽取數字、核對本地名稱,再形成摘要或初稿;來源檢查、風險分級、指定人員覆核、任務分派和正式歸檔等,交給已測試的流程通常更穩。實際架構既可以由工作流在需要理解和判斷時調用 agent,也可以由 agent 調用已驗證的工作流完成送審、分派及留痕。
第三,人仍在流程中,也就是「人在迴路」(Human-in-the-Loop, HITL)。 低風險、可逆的工作可以自動完成;而涉及金錢、政策、合約或個人權益時,AI 可以準備材料和建議,決定由指定人員作出。人工覆核也不能只加一個「批准」按鈕便了事。審批人需要看到來源、版本、風險和執行紀錄,才有條件承擔判斷。歐盟 AI Act 的風險分級框架,也把活動日誌、可追溯性和適當人工監督列為高風險系統的重要要求。
第四,模型以外的能力決定 AI 能否進入生產。 知識、工具、權限、日誌、版本、重試、回退、人工接管和持續評測,任何一項欠缺,都可能令一個漂亮的演示停在會議室裡。NIST 在 2026 年啟動關鍵基礎設施可信 AI 專項工作,仍然以可重複、覆蓋完整生命週期的風險管理為主線。Stanford HAI 同年的資料則顯示,已記錄的 AI 事故由 2024 年的 233 宗增至 2025 年的 362 宗,可見負責任 AI 的評測和披露仍追不上能力發展的速度。
Agent 處理理解與判斷,工作流管理執行與留痕,人在迴路中保留授權和例外接管。
我們走過的 AI 產品路徑
筆者團隊的 AI 產品進化路徑,與上述方向大致一致,起點卻有明顯不同。多年累積的調研、數據分析、社交聆聽和專業洞察報告交付能力,構成了這條路徑的起點。不同產品和服務表面各自獨立,底下共享同一套工作流:收集數據、判斷來源、理解本地語境、形成洞察,再把成果帶入決策和行動。
這些能力後來逐步匯入一個企業級工作平台 ,讓政府和企業把輿情分析和市場情報、調研互動、內容生成、審批及任務執行接成同一條工作流程,並以「聆聽、互動、生成、行動」組織工作。再往下一層,我們建立共用的Agentic AI 底座 ,把模型路由、知識調用、可重用技能(skill)、工具、任務編排、權限、日誌和人工覆核接在一起。
我們目前把能力分成三個工作層面。第一個層面是已經可以正式交付的標準功能,例如寫作、翻譯、摘要、文字辨識和語音轉文字。第二個層面是要與客戶共同設計的場景,例如接入客戶自己的知識庫、身份系統、審批流程或內部軟件。第三個層面集中處理 AI 治理、責任與邊界控制,包括誰可以使用甚麼數據、哪些行動需要批准、如何留痕,以及出現例外時由誰接手。
三個層面分別處理標準任務、客戶場景和治理控制,同一項目往往會同時用到。把這條界線說清楚,比在簡報上畫一條華麗的升級路線更重要。
這段經驗給了我們一個認知上修正的機會:Agent 自主程度與組織治理程度是兩條軸。 治理要求很高的平台,未必需要高度自主;一個能自行選工具、跨系統操作的 agent,也可能欠缺身份、審計和責任邊界。
我們做對了甚麼,又帶來哪些創新
回頭看,我們做對了三件事。第一,沒有把模型當作產品的全部,而是由數據、研究方法、本地語境和真實工作流程出發。模型可以更換,但客戶累積下來的知識、規則、模板和審閱標準則要留在系統裡。
第二,我們把 agent、可重用技能和工具調用放在共用底座,讓不同項目按需要組合知識、工具、流程與治理能力,毋須每次由零開始重建。
第三,我們把前線項目同時視為交付和產品驗證。項目除了完成客戶工作,也要驗證哪些方法可以標準化,哪些規則只能留在特定場景中,避免把一次性的定制誤當成通用能力。
以創新方法論推動項目走向可信、可驗收
我們近期完成了一個高合規的智能政務助手實驗項目 ,任務是根據部門附件生成可送審的正式文本,使用者需要核對數據、證據、文件種類、格式和最終文件。我們以同一組 15 宗任務及附件,分別測試基線版和改良版。按相同的任務、證據及格式準則評分,平均質量分由 62.9 升至 77.5 ;內容、證據和格式全部合格的任務由 4 宗增至 11 宗,即端到端通過率由 26.7% 升至 73.3% 。15 宗任務均能生成指定正式文件,但完成交付不代表內容合格;按項目既定口徑記錄的關鍵質量問題亦由 23 項降至 7 項 。
用戶體驗層面採用配對 A/B 測試 。我們在相同任務、附件和交付要求下,同屏並列展示兩個版本,讓實際用戶比較內容是否清楚、自然、可信、符合工作需要,以及是否願意採用。部分測試亦直接比較「不調用本地知識庫」與「調用本地知識庫」 的結果,觀察正式名稱、政策規則、部門用語、模板和證據邊界能否帶來可辨識的改善。
這種測試比純技術基準更接近本項目的交付要求,但用途不同,不能直接比較優劣。Kapoor 等人的獨立研究也指出,現有 agent 基準測試過度集中於準確率,經常忽略成本、可重現性及下游場景是否真正適用。我們的測試同時檢查技術表現、用戶評價和正式交付,結論很令人鼓舞。
測試亦顯示,改善來自任務規格、數據邊界、本地知識、核查規則、固定測試和人工反饋。單靠修改提示詞(prompt)或更換模型,很難穩定地重現同樣結果。
以前完成一個項目,留下的是報告和文件。現在還要留下可合法重用的數據結構、知識、模板、規則、可重用技能、工作流、測試及驗收證據。這些資產讓下一個項目毋須由零開始,也把知識與驗收標準留在組織內。少了這一步,定制項目做得越多,技術債通常也越多。
市場最常見的誤區
第一個誤區,是把 agent 當作可以獨立工作的「數碼員工」 。員工有職責、授權、經驗和法律責任;Agent 是模型、數據、提示詞、工具及權限組成的軟件系統。它可以執行任務,但不能自行承擔後果。
更麻煩的是,agent 不一定用報錯方式顯示失敗。它可能引用錯誤版本、誤解政策、重複提交操作,或在缺少證據時補上一段很順口的內容。系統表面完成了任務,錯誤卻悄悄進入下一個環節。
第二個誤區,是把 copilot 視為最終形態,或者反過來認為它已經過時 。政策分析、法律意見、策略選擇和創意發展,本來就需要人反覆追問、比較和取捨,copilot(由人主導的 AI 助手)仍有明確的價值。當然,它的限制也很明顯。如果員工仍要自行找文件、複製數據、逐句下指令,再把結果貼回幾個系統,AI 只加快了眼前的一小段工作,沒有改變任務的整體流轉。
第三個誤區,是以為 agent 愈多,系統便愈成熟 。每增加一個 agent,便增加溝通、延遲、成本和錯誤傳遞。若一個 agent 配合兩個已驗證的工作流已能完成任務,沒有必要另組一個虛擬的董事局來開會做決策。
第四個誤區,是把企業採用畫成「copilot、工作流、agent」的直線階梯圖 。自動整理公開新聞可以提高自主程度;涉及福利資格或合約審批,即使用同一模型,也要保留指定人員執行批准任務。企業要按任務風險、數據敏感度和責任要求選擇最優組合。
第五個誤區,是把「AI 會取代哪些崗位」當成最小的單元 。現實中,一個崗位通常包含數據整理、初稿製作、專業判斷、溝通協調、審批及承擔責任等多項職責。Stanford HAI 轉述的 2025 年 McKinsey 調查顯示,約三分之一受訪者預期所在組織未來一年會因 AI 減少人手;報告同時指出,整體就業數據尚未顯示廣泛而一致的職位流失。未來較可能先出現的情況,是AI 逐步嵌入部分職責和工作單元 :接手高頻整理、檢索、生成和核查,再由人處理例外、授權、取捨及最終責任。企業軟件也會由管理職位和流程,走向動態分配每一項任務,是由人、agent 還是固定工作流來完成。
企業軟件正在變成任務治理系統
傳統的流程型軟件即服務(Software as a Service, SaaS)主要記錄由誰處理任務,以及工作進入哪個階段。加入 agent 後,系統還要決定此刻由人、AI 還是固定流程執行 ;Agent 可以讀取哪些數據、採取哪些行動;甚麼情況需要批准;如何證明任務完成;失敗後怎樣復原。
企業的 AI 評分卡也要更換。帳號數、登入率和模型調用量(token)只能反映工作活動情況。更實際的指標包括任務完成率、首次通過率、人工接手率、處理時間、返工量、每項成功任務的總成本 ,以及任務完成後留下多少可重用的資產。我們在項目中看到,人工核對、錯誤重跑、格式修補和跨部門溝通,經常比 token 單價更影響總成本。
未來兩三年,市場會爭六件事
第一是agent 身份和最小權限 。企業要知道每一個 agent 代表誰行動、可以讀甚麼、可以修改甚麼,以及權限何時失效。它需要獨立身份、授權範圍、操作日誌和緊急停用機制,不能共用一個權限過大的系統帳號。歐盟和 NIST 在 2026 年的治理方向,都把可追溯、人工監督和完整生命週期風險管理推到更實際的位置。
第二是持續評測 。政策、數據、模型和用戶行為都會變,上線時通過測試,不代表三個月後仍然可靠。企業需要固定測試集、真實失敗案例、版本對照、回歸重跑和小範圍發布;表現退化時,還要能回退到上一個可靠版本。Stanford HAI 所記錄的事故增長與評測缺口,說明評測不能只在上線前做一次。
第三是模型可替換 。同一個模型未必同時適合高風險判斷、大批量摘要、本地部署和低成本任務,平台要能按準確度、速度、價格、數據駐留及權限要求選擇模型。企業自己的知識、流程、測試、權限和歷史紀錄應留在組織手上;更換模型時,工作方法不必重新開始。
第四是產品護城河 。只在通用大型語言模型(LLM)外面加一層介面和提示詞,卻沒有專有數據、工作流程、治理控制及持續評測的純套殼產品,很容易被模型供應商或大型平台吸收。能夠沉澱行業知識、客戶規則、審批、測試和交付責任的產品,才有機會建立自己的工作系統。
第五是任務經濟 。市場會少問建了多少個 agent,而多問每完成一項合格任務花多少錢。總成本不能只計 token,還要加入人工覆核、失敗重跑、系統接入和維護。企業採購 AI 時,也會由比較功能及帳號價格,逐步轉向比較每項任務的完成率、錯誤成本和人工接手比例。
第六是商業模式 。收費方式可能由帳號與用量,逐步加入任務完成、採用率、節省工時或業務結果。這會迫使供應商與客戶先說清楚基準、計算方法、數據來源和責任邊界;否則,平台很難證明成效究竟來自 AI、流程改善,還是人員額外投入。沒有可信評測,成效收費只會變成另一種市場口號。
Agent 要接手更多企業工作,來源、操作紀錄、批准條件和責任人便要留在同一條流程裡。少了其中一項,完成任務也不等於可以交付。 這是我們的實戰經驗。
參考文獻
European Commission. (2026, August 3). AI Act . https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai
European Parliament & Council of the European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence . https://eur-lex.europa.eu/legal-content/EN/TXT/?uri\=CELEX:32024R1689
Kapoor, S., Stroebl, B., Siegel, Z. S., Nadgir, N., & Narayanan, A. (2024). AI agents that matter . arXiv. https://doi.org/10.48550/arXiv.2407.01502
Microsoft. (2026, April 10). Automate business processes with agents plus workflows in Microsoft Copilot Studio . https://www.microsoft.com/en-us/microsoft-copilot/blog/copilot-studio/automate-business-processes-with-agents-plus-workflows-in-microsoft-copilot-studio/
National Institute of Standards and Technology. (2026, April 7). Concept note: AI RMF profile on trustworthy AI in critical infrastructure . https://www.nist.gov/programs-projects/concept-note-ai-rmf-profile-trustworthy-ai-critical-infrastructure
OpenAI. (2026, July 22). Introducing OpenAI Presence . https://openai.com/index/introducing-openai-presence/
Stanford Institute for Human-Centered Artificial Intelligence. (2026). The 2026 AI Index report . https://hai.stanford.edu/assets/files/ai\_index\_report\_2026.pdf
阿里雲。(2026)。工作流應用 。https://help.aliyun.com/zh/model-studio/workflow-application/
by angus | 2026-02-06
近日軟件股暴跌引爆「AI焦慮」:市場押注代理型AI改寫入口,SaaS介面與按席位收費遭質疑,口號是「AI即軟件」。我對此有不同的看法:企業價值在於治理與問責(權限、合規、追溯),入口變了,責任鏈反而變得更重要;股價重估的是位置與變現,不是SaaS軟件被消滅。
踏入2026 年2月,摩根士丹利追蹤的美股中的軟件板塊出現累計15%的跌幅 ,SaaS公司估值大跌,引起市場震動。Adobe、Salesforce、Oracle等公司股價顯著下滑;追蹤軟件股的 iShares ETF(IGV)在一周內蒸發近 1 兆美元市值。同一時間,半導體相對強勢,「硬強軟弱」形成鮮明對比。
這種跌法帶來了單純的風險偏好切換之外,更是一種更刺骨的焦慮:投資者開始懷疑,過去二三十年用「席位數(per seat)+訂閱」堆起來的企業軟件帝國,是否正在遇到一種會改寫入口的力量。市場對 AI 的恐懼,表面看是技術,骨子裡是秩序——誰掌握工作入口、誰擁有定價權、誰能把「工具」變成「結果」。
市場觀點:SaaS 黃昏、介面負資產、付費邏輯將被結果付費取代
近期流傳甚廣的一種解釋框架,大意可濃縮為幾個關鍵點:
導火線被描述為代理型 AI (agents)產品的推出(例如 Claude Cowork)。代理的意思很直白:不只回答問題,還能跨應用自主執行任務、檢查結果,把「做事」這件事從人手移交給系統。加上今天 Claude 4.6 和 GPT 5.3 的華山論劍激鬥,劇情更加緊湊。
因為代理能產出「結果」,企業可能不再需要大量登入 SaaS (Software as a Service) 平台、填表、點按鈕的人;介面與學習成本反而可能從護城河變成包袱。
SaaS 的核心商業模式被歸納為「按席位收費」:人越多、席位越多、收入越高;若代理可以替代初級人力,席位需求下降,增長模型就斷裂。
於是市場給部分傳統 SaaS 打上「中間人」標籤:介面是累贅、後台 API 才是戰場,未來的定價會從訂閱轉向「按結果付費」 (outcome based);能做出「AI 員工」的公司將成為新巨頭。
這套敘事之所以傳播迅速,是因為它簡潔、有戲劇性、而且和股價下跌在時間上互相配合:一邊看到拋售,一邊看到「代理可以直接把事做完」,人自然把兩者扣在一起。市場喜歡這種故事,因為它能把複雜的估值調整,簡單來說:舊物種淘汰。
我不否認這些觀察針對「市場如何想像未來工作入口」有其啟發性;但我不讚同它被用作結論,更不讚同它被用作企業級判斷的起點。原因不是它太激進,而是它太「外部視角」:它主要從投資敘事、產品替代、定價方式去看世界,卻把企業內部真正決定成敗的運作邏輯,輕輕放過了。
AI 影響無可置疑,但「 AI 即軟件」與「 SaaS 日落」都少算了企業那一半
從我們的經驗來說,AI 在寫程式、生成方案、加速開發上,確實正在把「產出程式碼」變成可批量供應的能力。從職能分工到成本結構,都會被重排,市場重估並不奇怪。
但如果此時說「AI 即軟件」、「代理=結果交付=席位終結」而去直接宣判大型 SaaS 的黃昏,未免言之尚早。這些宣稱之所以站不住腳,是因為它們把企業級系統當作「功能集合」來看,彷彿只要能把任務做完,企業就會自動買單、流程就會自動改寫、責任就會自動消失。
其實,企業世界剛好相反。越接近核心流程,越不會只看「能不能做」。我們要看的是,「做完之後誰負責、如何控制、如何追溯、如何合規」。技術可以是引擎,但企業需要的是可運作、可治理、可交代的系統。
企業級軟件的價值,除了介面和結果,還有「可被信任的運作方式」
如果軟件可以完全獨立於企業管理、文化與業務流程,那麼「AI 即軟件」可以成立:輸入需求、輸出功能,像即食麵一樣方便。
可現實是,企業級軟件的昂貴部分,常常不只是程式碼,還有把一套組織共識固定化的成本:權限如何設計、審批如何留痕、合規如何通過、例外如何處理、風險如何隔離、出了事如何追責。更麻煩的是,企業的真規則往往不在需求文檔,而在那句含糊但極具權力的話:「一直都是這麼做。」你要讓 AI 介入核心流程,首先就得把這句話翻譯成可執行、可審計、可追溯的規則。這一步不是技術問題,而是組織治理問題。
因此,把「介面」貶為負資產、把「結果交付」抬為唯一價值,在企業級語境裡往往過於單薄。企業為何付費,很多時候不是為了更炫的交付方式,而是為了在監管、審計、內控的壓力下,仍能穩定運作,並且在出錯時能交代清楚:發生了什麼、誰批准了什麼、何時改動、依據是什麼。
代理型 AI 的確會改變入口,但入口改變不等於治理消失;席位模型受壓,不等於企業會把核心權力交給黑盒
市場敘事常把未來描述成這樣:一句話交付任務,系統自動完成,全程零人手介入。作為產品演示,它著實迷人;但作為企業治理,它比較危險。
企業不缺「能做事」的工具,缺的是「做事後能負責」的機制。代理越能自主行動,企業越需要把關:它以什麼權限讀了哪些數據、做了哪些修改、輸出了什麼建議、誰最後放行、出了問題如何追溯。這些都是運作邏輯,而不是功能清單。
所以,很多時候,我跟同事們強調,要把企業級 AI 看成「把一位能力極強的新同事」塞進公司:他很能幹,但不會第一天就拿到財務審批權、折扣定價權、合規簽字權。這樣做不是對能力的懷疑,而是要確保責任鏈不能斷。代理改變入口的同時,也會把治理要求推到更前面——控制面(control plane)會比介面更重要,而控制面本質上是管理工程,不是純粹的軟件工程。
席位模型確實可能承壓,這點市場說得不無道理;但「席位下降=SaaS 帝國崩塌」是把企業採購與內控邏輯想得太線性。企業採購從來不是只看成本效率,而是搭配風險承受能力與問責結構。能省錢,但交代不了,往往省不成;能提效,但風險不可控,往往不敢放進核心鏈路。當然,隨著AI的發展,現在很多SaaS已經不再單純按席位收費,席位+訂閱+用多少付多少(PAYG)的混合模式了。
股價下跌其實反證了「 AI 即軟件」的簡化 —— 市場正在重估的,是位置,而不是技術是否存在
如果「AI 即軟件」是一條清晰、可直接獲利的道路,那麼軟件股理應因「軟件升級」而普遍受益。但現實是:軟件股被拋售,因為投資者擔心代理型 AI 跨應用完成任務會削弱 SaaS 護城河;同時也擔心傳統軟件公司 AI 產品變現緩慢,尚未顯著提升營收。這兩點表明,市場並不是否認 AI 的重要性,而是在質問:你在新入口與新價值鏈中,還站在原來的位置嗎?你的定價權還穩嗎?你的收入增長模型還成立嗎?
換句話說,市場恐懼的焦點其實很清楚:它怕的不是 AI 會不會存在,而是 AI 會把價值挪到哪裡去。半導體相對走強,也符合這種心態:鏟子先賣得出去,故事更短,回款更快;至於應用層誰能在治理與變現上跑通,市場選擇更苛刻的等待。
AI 會讓軟件更便宜,但企業不會因此更簡單;企業級 AI 更像一場秩序重組
對於那種把世界拆成「舊 SaaS=介面與資料庫」和「新代理=結果付費」的二分法,我比較有所保留。因為它把企業內部最昂貴的部分漏掉了:權責、流程、合規、風險邊界與企業文化協作。這些東西既不在股價曲線裡,也不在產品演示裡,但它們決定了企業是否敢把 AI 放進核心流程,決定了所謂「結果交付」能不能規模化、能不能被信任。
AI 的確會改寫軟件,也會改寫 SaaS 的定價與分發;但更深層的改寫,是企業如何把技術納入治理,如何把「能做」變成「可控、可追溯、可交代」。在這個層面上,AI 不只是軟件,它更像一股迫使組織重排權力、重畫流程、重建責任的力量。
SaaS指數的大跌把焦慮放到枱面上,反過來看是件好事。至少它迫使我們放下口號,回到企業的常識:技術可以很快,組織很難很慢;而真正的護城河,既不是軟件的介面,也不是一句話就能交付的「結果」,而是長期可被信任的運作方式。
參考資料
2026 年初軟件股下跌15%,創下自2022 年以來的最差開局 https://longbridge.com/zh-HK/news/272915453
機構稱「沒有理由持有」!美股軟件股陷入「AI焦慮」,板塊估值跌至多年低位 https://hk.investing.com/news/stock-market-news/article-1274005
巴克萊力挺 Salesforce、Oracle、DigitalOcean,預期 AI 變現助力估值重塑 https://hk.investing.com/news/stock-market-news/article-1266530