Generic selectors
Exact matches only
搜索的标题
Search in content
Post Type Selectors

Sign in

a
Generic selectors
Exact matches only
搜索的标题
Search in content
Post Type Selectors
a
創新 · 2026年9月2日 · 10 分鐘閱讀

政府公文 AI 的第 90 天

頭三個月好用是應該的,往後撐不撐得住,要看人在迴路的兩個崗位

政府公文 AI 的第 90 天

近日,鄰近地區有兩宗政務 AI 的公開消息。

一宗來自某地方政府。當地每月產出約一萬份公文,熟手處理一份最快要二十分鐘,導入公文智能系統後縮短至兩分鐘,二十三個局處全面啟用。系統先以五千份公文建立評測基線,再從近五年的歷史文件中篩選兩萬份作為素材(按此閱讀報道)。

另一宗來自另一個地區。當地政府把經技術審查、適用於政務場景的 AI 方案編成目錄,超過二百六十項,涵蓋文本摘要、自動翻譯、數據分析和公文輔助寫作,同時發布部門應用指南,並為公務人員安排過百項數字科技培訓(按此閱讀原文)。

兩則消息的數字都很亮麗,重點落在系統啟用、方案供給和培訓規模。第一宗經過半年試用,報道交代了公文製成時間由二十分鐘縮短至兩分鐘,卻沒有提到錯誤率、初稿要改幾次、人工重做多少,或者哪些部門仍在持續使用。這些數字較難看,也更能說明系統過了第 90 天之後的表現。

筆者團隊正在做的公務智能平台項目裡,這段變化見過不止一次。頭一個月的數據好看到不用解釋,到了第三個月,同事和用戶談論系統的方式會慢慢改變。

導入初期的好感,來自格式複現

公文寫作有相當一部分工作是格式複現。稱謂、行文套語、段落結構、行政邏輯、前例參照都有既定做法。把歷史公文整理成可供查找的檢索庫,讓系統按情境調出相近舊件,再據此起草,通常會有不錯的效果。業界稱這種做法為檢索增強生成(retrieval-augmented generation, RAG),系統先找出相關內容,再拿來生成答案。

原本二十分鐘的例行公文,兩分鐘便有初稿,這個落差足以令任何部門在頭一兩個月感到好用。格式複現是 RAG 擅長的工作,處理得好,確實能省下大量時間。麻煩往往在之後出現。

好感怎樣在三個月內改變

用戶對新系統的評價通常會隨時間變化。傳播學與信息系統研究分別解釋過其中幾種現象,把它們放回同一段使用歷程,便能看見評價如何改變。

初期先有新奇效應(novelty effect)。新工具因為新鮮,往往得到較高評價和使用率;人熟悉之後,這部分好感會逐漸淡去。多數系統的宣傳材料,採用的正是這一段數字。

接着出現期望不確認(expectation disconfirmation)。用戶是否滿意,會受實際表現與事前期望的差距影響。二十分鐘縮短至兩分鐘後,兩分鐘很快變成日常,省下的時間不再顯眼,剩下的錯誤卻愈來愈礙眼。

剛開始,系統處理的多是高頻、格式化公文。這一批做完後,留下的長尾案例難度較高,整體準確率可能隨之下降。用戶未必會把原因拆開來看,他們感受到的是系統好像退步了。

幾次錯誤之後,算法厭惡(algorithm aversion)便可能出現。研究發現,人看到算法出錯後,放棄它的速度遠快於看到人出錯後放棄那個人,即使算法整體表現較好。公文系統只要幾次引用過期職銜或已廢止條文,便足以損害一個部門的信任。用戶很少逐類判斷哪些任務做得好,往往把折扣算在整套系統身上。

按筆者團隊在開發政務AI平台中的觀察,模型換得快,用戶的習慣也定得快。拿第一個月的表現推算第三個月,誤差可以很大。

歷史公文會過期,檢索和微調都認不出來

用戶評價改變時,歷史公文也在悄悄過期。五年文件裡可能有已廢止的法規條文、改組前的部門名稱、已離任人員的職銜和停辦計劃。單純按相似度檢索的系統,分得出哪一份寫得最像,分不出哪一份今天仍然有效。

系統找出一份舊公文,格式齊整,語氣也得體,引用的卻是三年前的組織架構。這種錯很難揪出來,因為整份文件讀起來十分正常。承辦人員若不熟悉相關領域,簽出去前未必察覺,等到有人指出,文件可能已經對外發布。

市面上常見兩種處理方法。第一種是前文提到的 RAG,把歷史文件整批放進檢索庫,讓系統按相似度尋找,再把找到的內容交給模型生成公文。它起步快、成本低,短期效果也容易看見;限制是相似度只管像不像,不會判斷文件今天是否仍然生效。愈是寫得標準的舊公文,系統愈容易把它找出來。

第二種拿歷史公文再訓練模型,讓模型學會當中的行文習慣,業界稱為微調(fine-tuning)。微調有助掌握格式、語感和文種,過期內容也可能一併進入模型,而且清理起來比檢索庫麻煩。檢索庫刪除一條,當天便能生效;已經練進模型的舊職銜,通常要重新訓練,仍未必清得乾淨。

換一個更大的模型也補不上這個缺口,因為沒有人告訴系統哪一條已經作廢。採用檢索還是微調,在這裡只是技術選擇;數據狀態有沒有人持續維護、維護得有多細,才會逐步拉開系統的準確性和穩定性。演示(demo)和概念驗證(POC)使用的多是現行文件,答案清楚,這個差距不易暴露。到了第 90 天,它才慢慢浮上來。

人在迴路的兩個崗位

以上兩種退化各要有人接住。業界統稱這種安排為人在迴路(human-in-the-loop, HITL),意思是在要緊關口保留人的判斷,由人決定輸出能否繼續往下走。多數人談 HITL,會把它理解成合規覆核,像在文件上蓋一個章。張Sir認為,這個迴路需要兩個崗位,處理兩類不同問題。

用戶端的人。 承辦人員可以改稿,審批人也能看見生成依據。研究算法厭惡的學者後來再做實驗,發現只要容許用戶稍微修改算法輸出,他們便較願意繼續使用一套會出錯的算法。覆核除了把關,也有助維持採納率。一套只交出最終答案、不讓承辦人員插手的系統,出錯後較難挽回;把改稿權留給人,系統才有機會在錯誤之後重新取得信任。

平台端的人。 數據狀態要有人維護,包括哪一條現行、哪一條已撤銷、哪個部門改了名、哪個職銜換了人。這項工作要按週期進行,做得再好也很少有人看見,卻會決定系統到了第二年是否仍然準確。

平台端這個崗位,多數科技廠商不會替公務人員承擔。合約一般涵蓋系統交付、功能開發和技術支援,數據由誰更新、多久更新一次、更新到甚麼程度才算合格,往往沒有寫清楚。系統上線時,這個崗位可能仍然空着,代價要過一段時間才會出現。

用戶端的人隨件出現,一份公文擺到面前,他改一改,決定簽還是不簽。平台端的人不對着公文,他對着數據,每隔一段時間清理過期內容。少了前一個,系統出錯後容易失去用戶;少了後一個,系統會愈用愈舊,而且舊得無聲無息。

第 90 天要看的六項指標

帳號數、開通部門數、登入率和生成份數,反映的是有沒有人點過系統。要知道這套系統是否值得繼續投入,可以換一組數字來看。

  • 任務完成率,交出去的內容有多少真的能用
  • 首次通過率,初稿一次過關的比例
  • 人工接手率,有多少任務最後仍要人手重做
  • 返工量,平均改多少輪才定稿
  • 每項成功任務的總成本,把人工核對、錯誤重跑、格式修補和跨部門溝通一併計算
  • 可重用資產,核准表述、模板、規則和失敗案例有沒有留下來

在筆者團隊正在做的公務智能平台項目裡,導入 90 天後,前四項往往比帳號數和生成份數更能反映實際使用情況。最後一項最容易被忽略,它會影響同一筆投入到了第二年還能留下多少價值。

看完這六項,還可以追問一句:「上線 90 天之後的數字,公布過沒有?」這組數字現在仍然少見,多數 AI 產品宣傳停在開通部門、生成份數和節省時間。

公文要簽署、要負責、要備查,這幾件事不會因為初稿改由 AI 起草而消失。系統能陪一個部門走多遠,仍要看兩個崗位有沒有人一直站着:一個守住每份文件,另一個守住系統每天使用的數據。

協作者:張Sir和AI

參考資料

Dietvorst, B. J., Simmons, J. P., & Massey, C. (2015). Algorithm aversion: People erroneously avoid algorithms after seeing them err. Journal of Experimental Psychology: General, 144(1), 114–126. https://doi.org/10.1037/xge0000033

Dietvorst, B. J., Simmons, J. P., & Massey, C. (2018). Overcoming algorithm aversion: People will use imperfect algorithms if they can (even slightly) modify them. Management Science, 64(3), 1155–1170. https://doi.org/10.1287/mnsc.2016.2643

Oliver, R. L. (1980). A cognitive model of the antecedents and consequences of satisfaction decisions. Journal of Marketing Research, 17(4), 460–469. https://doi.org/10.2307/3150499

0

LATEST

政府公文 AI 的第 90 天

政府公文 AI 的第 90 天

近日,鄰近地區有兩宗政務 AI 的公開消息。 一宗來自某地方政府。當地每月產出約一萬份公文...

免費訂閱「張Sir開的方」

會員登入

還沒有帳號? 立即註冊