各執己見:機器仲裁成為新市場

作者:Thejaswini 來源:Token Dispatch 翻譯:善歐巴,金色財經

我們似乎把整個文明建立在這樣一個事實上:證據與認可,並不是同一回事。

人們默認研究者要引用真實、直接的來源;默認設計師明白「簡潔」不等於交一張白紙;被要求做一個能跑通的結賬流程的開發者,也默認不會讓它加載四分鐘。人類在承接這些未言明的語境上出奇地擅長,因為我們共享一套關於「合理的工作長什麼樣」的基本感覺。軟體從來不太需要這些,因為我們通常給它的指令都窄到可以逐字執行。

如果你看過《奧維爾號》里那一段,就知道我在說什麼:

AI 智能體開始在一個更混亂的世界裡工作:指令不會把「怎樣才算把活兒干好」全部寫清楚。一旦錢掛在那些缺失的語境上,解讀本身也就成了交易的一部分。

如果有人花 15 美元請一位自由職業者調研 20 家公司,任務說明也算清楚,他會期待什麼?找到這些公司、說明每家是做什麼的、使用獨立消息,並在指定日期前交出報告。當成果按時交付、20 家公司一個不落,接活的人就認為活兒幹完了。

買方的看法卻不一樣。幾處引注指向的是公司自己的部落格,還有兩段描述幾乎是逐字照搬。

如果雙方都是人,接下來的戲碼就是爭論、甩截圖、翻出原始任務說明來回扯。若仍然談不攏,最終可能得由第三方來裁定這份活兒夠不夠格拿錢。

如果兩邊都是 AI 智能體,又會怎樣?

錢本身並不難處理。

  • 託管合約可以先扣住這 15 美元,直到活兒幹完。

  • 區塊鏈能顯示款項何時存入、成果何時提交。

  • 身份系統可以確認到底是哪個智能體乾的活。

  • 簽名記錄可以留存雙方當初約定的指令。

真正的難題在於:總得有人讀懂任務說明、檢查成果,判斷賣方到底有沒有把活干好。

商業世界一直有針對這類問題的機構,只是我們通常在出事時才會注意到它們。當 PayPal 的買家聲稱貨沒到、或者與描述完全不符,雙方先有機會自行解決;如果談不攏,一方可以把糾紛升級為索賠,請 PayPal 核查證據、判定誰有理。PayPal 稱,多數裁決大約需要 14 天,少數要 30 天甚至更久。

更大的商業糾紛有自己的一套機器。美國券商歸行業自律組織 FINRA 管,它營運着自己的仲裁論壇:2025 年收到 2,597 件新案,平均要 13.4 個月才結案。非營利機構美國仲裁協會表示,2025 年有 58 萬件案子提交給它,其中企業與企業之間的索賠與反索賠金額超過 290 億美元。同年,國際商會收到 881 件新仲裁案,其在辦案件總值達到 2,990 億美元。這些顯然比智能體眼下可能遇到的糾紛大得多,但它們說明:一旦交易足夠多,人們吵架的頻率就足以催生一整個行業——專門看證據、判斷誰該拿錢。

AI 智能體開始從另一端提出同類問題:交易金額可能極小而頻率極高,傳統的糾紛處理流程根本派不上用場。

Visa 和 Artemis 研究了兩套面向機器對機器商務的新興支付協議,發現 x402 自 2025 年 5 月上線到 2026 年 4 月,處理了約 1.096 億筆經調整的交易,總價值約 1,500 萬美元。在 Visa 考察的這些協議上,單筆支付平均只是幾分之一美分。為了幾美分的爭議,雇一支人工客服團隊花半小時去查,完全不劃算。

我去查了查誰在做這件事,找到了 GenLayer,它想把這件事變成基礎設施。

GenLayer 自己造了一條區塊鏈,專門處理普通智能合約難以勝任的判定。傳統智能合約擅長的是:每台機器做同樣的計算都能得到同樣的結果,比如判斷錢到沒到、期限過沒過。麻煩出現在需要「讀一段東西並理解它」的時候——也許是通讀一份研究報告、看一個網頁、讀明白合約里的某一段,或者判斷一張圖是否符合創意要求。AI 模型的回答從不一致:面對同樣的材料,它們的結論可能各不相同。於是「每個節點必須得出完全相同輸出」的前提就站不住了。

GenLayer 有一個叫 Intelligent Contract 的東西。它不再要求每個驗證者產出完全一樣的文本,而是讓多個驗證者根據寫進合約里的規則,判斷某個提交的結果是否可接受。驗證者在判斷時可以使用大語言模型和公開的網路數據。

乍看之下,這像是智能體技術棧里又一塊缺失的拼圖。但已經有別的系統在做其中一部分工作,所以 GenLayer 並非從零起步。它更具體的角色是:當雙方仍各執己見時,判定證據究竟意味著什麼。

谷歌的智能體支付協議 AP2,已經能為「智能體被授權買什麼、商家提供什麼、哪筆支付獲批」生成帶密碼學簽名的記錄。其規範明確寫道,這些授權與收據日後可以作為爭議中的證據。但 AP2 本身並不判定誰對誰錯、錢該給誰——它只是保存一份可信的事件記錄,把解讀這份記錄的過程留給別人。

以太坊針對智能體身份與聲譽的標準 ERC-8004 也有一個驗證註冊表。智能體可以把工作提交上去,由另一個系統核驗,核驗結果隨後可以上鏈、記入該智能體的履歷。區塊鏈能顯示錢有沒有動,所以支付類糾紛好辦;當糾紛需要外部資訊才能了結,就由預言機把資訊帶上鏈。可見有一塊明確的空缺:證據擺在那裡,總得有人判斷它意味著什麼,這正是 GenLayer 切入的地方。

為了看清真實的工作有多少落在各類里,我在 Slack 上的智能體(我盲目信任它,畢竟我們是一夥的)在 9 月 24 日抓取了 300 多條在線任務列表,來源包括 Freelancer.com、Fiverr、Upwork、Scale AI 旗下的 Outlier、Prolific,以及鏈上任務市場 Daydreams TaskMarket。我的智能體說,約 23% 的任務可以簡單用「是/否」判定;另有 45% 主要依賴個人判斷;剩下 32% 有證據可查,但仍需判斷這份工作到底夠不夠好。

這不是一份市場規模估算,而且分類本身就出自 AI 的判斷。但意思你明白了:並不是每一項涉及 AI 的任務,都需要一個 AI 法庭。

像「設計最漂亮的餐廳 logo」這樣的任務,幾位驗證者也許都會同意某個設計比另一個更好看,但這種一致並不會把品味變成客觀標準。除非買方事先寫下了極詳細的創意要求,爭議的根源仍然是個人偏好。同理,一場營銷活動可能達成了承諾的互動量,但圍繞「這些互動有多少來自真實用戶」依然會有分歧。這兩種情況下都有證據可查,但在付款前都需要有人去解讀。

加密行業在去中心化糾紛解決上已經試驗多年,這些系統處理分歧的方式差別很大。

UMA 的樂觀預言機先假定一個主張沒問題,除非有人反對。提出主張的人要質押一筆保證金;若在等待期內無人挑戰,答案就被接受;若有人挑戰,則由 UMA 代幣持有者投票裁決。這套機制把成本壓得很低,因為多數主張無需完整審查即可通過,昂貴的投票只在有人挑戰時才會啟動。

Kleros 是建立在以太坊上的去中心化糾紛解決系統。它不靠公司雇員或法院裁決,而是隨機抽取質押了其 PNK 代幣的人擔任陪審員。若一方上訴,下一輪會引入更多陪審員。這讓 Kleros 適合那些真正需要人類判斷的案子,但也意味著流程既慢又貴:普通法院一輪三名陪審員,費用約 0.015 ETH,還不含上訴;因此當爭議本身只值幾美元時,這套模式毫無意義。

GenLayer 把 Kleros 交給人類陪審員的裁決工作,交給了 AI 輔助的驗證者。一個驗證者提出答案,其他驗證者來核查,若同意的人足夠多,結果就走向最終確認;若有人挑戰,會有一批新的驗證者重新審理,爭議繼續升級時,參與人數還會增加。另外,UMA 和 Kleros 也都在向 AI 輔助裁決演進,所以我不會把 GenLayer 說成這兩個「永遠靠人」的系統的「AI 替代版」。

如果規則寫得具體,驗證者就有實打實的東西可查;如果合約只說這份工作應該「有洞見」或「有原創性」,那麼幾個模型彼此同意,也不會讓這個標準變得更清晰。

GenLayer 用一個叫「等價原則」的機制來處理這一點:它告訴驗證者,答案要相似到什麼程度,網路才把它們視為同一個判定。有些合約可能要求完全一致;有些則允許驗證者用不同措辭或推理,只要在關鍵結論上一致即可。GenLayer 的文檔反覆鼓勵開發者把這類判定標準收窄。

這就把很大的權力交到了寫合約的人手上:由他決定什麼證據重要、什麼算成功、答案之間的差異多大才可接受。GenLayer 能依據這些規則作出判斷,但一旦爭議開始,它無法把一個模糊的標準變得更清楚。

一份裁決只有在能真正改變交易時才有意義。在實踐中,這意味著錢或其他有價值的結果必須與這一判定綁定起來。這樣爭議結束後,可以是資金被釋放、被退回,或者某個智能體的聲譽被更新。

對一筆小額的智能體交易來說,目標可能只是確保錢付給了正確的一方,而不是拿到一份具有法律強制執行力的判決。

那它到底在哪些地方真正有用?

智能體市場已經把「委託工作」和「支付」結合在一起,並越來越多地與鏈上身份掛鈎,所以這顯然是最值得看的方向之一。

以 Daydreams TaskMarket 為例,它跑在 Base 上,允許人類或 AI 智能體發布以 USDC 擔保的任務。它不同的任務形式,恰好揭示了裁決在哪些地方有用、哪些地方沒用。基準類任務可以讓接單者圍繞準確率、延遲這類可量化指標競爭;如果判據是明確的分數,比如一個智能體 96%、另一個 91%,平台直接核對數字、取更優結果即可。

但換成賞金任務,可能有好幾個人提交不同類型的成果,需求方得判斷哪個最好。這時如果沒有簡單的數字或規則告訴你誰做得更好,就必須有人去看成果、自己拿主意。

在軟體與安全賞金里,要求某個智能體讓一套固定測試用例全部通過的任務,可以機械地結算;而漏洞賞金則可能產生真正的分歧:這個漏洞算不算在範圍內、嚴重程度描述得準不準,或者是否已經有人報告過同一個底層問題。

在效果營銷里,數出 5 萬次社交互動很容易,但這些是真實用戶還是自動化賬號?GenLayer 已經在展示 Rally,一個用其驗證者分析社交活動、評估互動真實性的效果營銷應用。

服務等級協議(SLA)本質上是服務商與客戶之間關於最低服務水平的承諾。比如一家雲服務商可能承諾 99.9% 的可用性,或在兩小時內響應支持請求;若未能兌現,客戶可能有權獲得退款或服務抵扣。

如果協議已經明確規定了哪些日誌、哪些監控服務、哪些例外情況算作證據,自動化裁決者要處理的事情就窄得多。

研究類任務是很好的例子,它能檢驗 GenLayer 在哪裡好用、又在哪裡觸到天花板。研究工作的某些部分容易核查:報告有沒有回答全部問題?消息是不是真的?驗證者可以檢查這些。

但像「這個洞見夠不夠原創」這樣的問題就難得多,可能沒有任何明確規則或證據能給出定論。

這類工作無法用簡單的「是/否」腳本判定,但仍有足夠的證據和結構,讓不同的驗證者得出一個合理的判斷。如果任務幾乎完全關乎品味或模糊的質量,系統可用到的東西就少得多。

如果你以為用好幾名 AI 法官就能自動讓裁決變得可靠,那並不成立。

如果五名驗證者都用相似的模型,它們可能一起犯同一個錯誤:誤解同一條指令、相信同一個壞消息,或者全都被操縱過的內容騙過。GenLayer 試圖通過讓驗證者獨立核查,並在有人上訴時引入新驗證者,來降低這種風險。

證據本身也可能不可靠:網頁會變,API 在不同時間會給出不同答案,文檔里甚至可能藏有專門用來迷惑閱讀它的 AI 的指令。所以只有當驗證者能切實核查同一份證據時,系統才運轉良好。有時可能壓根就沒有明確答案,這時 GenLayer 可以返回「無法判定」,而不必強行給一個是或否。

GenLayer 的設計倚仗孔多塞陪審團定理,即一群獨立的推理者勝過任何單個個體。但這隻有在推理者真正獨立、且 AI 模型並非從重疊數據中學習時才成立。Kleros 的研究人員曾在一家拉美加密交易所的 99 起真實客戶糾紛上做過近似測試:ChatGPT 5.5 有 3 起支持客戶,Claude Opus 4.7 有 14 起。當他們用下一個版本的 Claude 重跑這些案子時,平台的勝率從 86% 升到了 95%。當模型的傾向是隨機的,混合使用不同的模型會有幫助;但如果整整一代模型都朝同一個方向偏移,混合小組也會跟着偏。

這個市場現在有多大?很難估,因為只有一小部分智能體交易最終會變成糾紛。但現有的系統已經顯示,對裁決的需求相當可觀。

2025 年,商戶處理了約 2.61 億筆拒付,按每筆 128 美元計算,對應的糾紛處理規模約為 330 億美元。而在另一端,GenLayer 目前每天大約產生 25,800 次測試網判定;即便按每次判定 1 美元算,一年也只有約 940 萬美元。作為對比,eBay 巔峰時期每年處理約 6,000 萬起糾紛,相當於每天約 16.4 萬起。只有當機器商務最終把糾紛量做到這個級別時,GenLayer 才可能成為一門大生意。

要讓這套機製成立,合約需要清晰的規則,證據需要可靠,驗證者需要足夠獨立,使他們的「同意」真正有意義,上訴也要保持廉價。

人類商業已經有了法院、仲裁和糾紛處理團隊,用來應對雙方對同一筆交易各執己見。如果智能體之間開始做更多生意,它們可能需要一套更快、更便宜的同類機制——畢竟機器對任何東西,都想要一個便宜又快速的版本。

也許,在我們教機器做其他所有事情之前,先教它們如何判斷什麼是公平,是件好事。

來源:金色財經

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。


相關貼文

prev icon
next icon