AI Agent 互動、博弈與社交的深度解析 Hung-yi Lee 2026-03-15

接下來,我們要來講 AI agent 之間的互動。今天我們已經知道,AI agent 它可以做一個獨立的個體,能夠做很多事情。當兩個 AI agent 相遇的時候,會發生什麼樣的事情?AI agent 的互動從來都不是新鮮事。人們最常使用多個 AI agent 互動的情境,是讓它們彼此協作完成更複雜的任務。有時候與其訓練一個更大更聰明的模型,不如拿三個模型一起解決同一個問題,看能不能發揮「三個臭皮匠勝過一個諸葛亮」的效果。

AI agent 的協作,這其實已經有滿坑滿谷的研究了。我這邊引用一篇比較早的論文,探討什麼樣的協作方式最有效。文獻觀察到,讓多個 agent 彼此討論,可能比單一個 agent 結果更好。但是討論方式有很多種,怎麼樣一起討論才是最好的方式呢?

在這篇 paper 裡面,它先把模型與模型、agentagent 間的互動,用一個 graph 來決定,用一個 有向圖 來決定。在這個 有向圖 上,我這邊畫了一個最簡單的例子,只有三個 node(節點)和兩個 edge(邊)。在這個 有向圖 上,每一個 node 代表一個模型,一個 LLMagent。有趣的是,在這篇 paper 裡面,它的每一個 edge 也是一個 agent

對這些作為 children 的 edgenode 而言,它們要做的事情是:先提出自己的 solution。比如說上面這個 node 提出了方案 A,下面這個 node 提出了方案 B。接下來,這兩個 edge 會根據前面這個 node 提出的方案,提供一些評論。然後,作為這個箭頭指向的 nodeagent,它會把前面這些 agent 的方案和建議集合起來,然後提出自己的方案。這個藍色的 node 做的不只是把前人的東西接在一起,它要做的是根據前人產生的內容,再提出自己的想法,看能不能夠綜合起來得到更好的想法。

在這篇 paper 裡面,它嘗試了不同的 有向圖,代表不同的協作方式。最簡單的是 接龍 (chain) 的方式,所有人排成一排,第一個做完傳給第二個,第二個傳給第三個,以此類推。

協作拓撲研究

它也試了 樹狀 (tree) 的結構,有兩種。一種是 星形 (star),只有兩層,一個人管所有的人。另一種是傳統的 樹狀,由一個人傳給中層的人,中層再傳給底層的人。不過,不要被這個 樹狀 結構騙了。多數人看到 樹狀 會想像成一群底層員工做好事,交給中階主管,再交給高階主管。但其實在這篇 paper 裡面,它的 樹狀 結構方向是反過來的。它試了兩種方向,發現跟你直覺相反的方向結果比較好。

所以在這篇論文裡面,它的 樹狀 結構是:先由主幹一個人提出想法,然後再分給不同的人發想,這些中階的人再分給底層的人發想,最後產生多個答案,然後由一個隱藏的 node 綜合起來。它發現這種「由少到多,由主幹到分支」的方法,其實是 樹狀 結構比較有效的利用方式。

除了 樹狀 結構,它也試了更複雜的 拓撲結構 (topology)。比如說在這個 Mesh 結構裡面,所有的節點都是兩兩之間有關聯性的。一個節點傳給另外四個節點,另一個傳給三個,以此類推,所有節點之間都有 edge 相連。還有一個是把這些 node 接成像是 類神經網路 的樣子,但它不是真正的 類神經網路。你可以想成每個原模型本身就是 類神經網路,所以每個 node 裡面都有 類神經網路,它是 類神經網路 再接成 類神經網路,是 類神經網路 的平方。還有一個是 random,這個 random 其實是從 Meshpruning(修剪)得到的,先接出 Mesh 結構,然後做一些 pruning,變成 random 結構。

最後,哪一個 拓撲結構 最有效呢?它比較了剛才提到的各種結構,發現最沒效的是「一個傳一個」(chain),這最沒達到分工合作的效果。在這個圖上,縱軸是模型的表現(quality),它做了四個不同的 benchmark(基準測試)和任務,並將結果平均。你會發現,chain 是最沒效的方式。橫軸是指動用了多少 agent。從一個一直到 64 個 agent,如果是 chain,動用最多 agent 是最沒用的。

比較有效的方法是 MeshRandom 這兩個方法,看起來比較有效。也許讓 agent 間有比較多的互動,結果會比較好。這篇 paper 也提到,不同任務最適合的協作 拓撲結構 是不一樣的,這很有可能是 case by case,每個任務都不同,還有很多可以研究的地方。

這邊你會發現,隨著 agent 越來越多,它們得到的 quality 會越來越好。這很像 scaling lawScaling law 指的是,你給一個模型越多的算力、資料、參數,它的表現可能會越來越好。對於 agent 的協作也是一樣,有越多的 agent 在團隊裡,結果有可能越來越好。不過,它這邊是有一個上限的,最後會 saturate(飽和)。所以到某個時間點後,再加更多 agent 可能不一定帶來幫助。也就是說,多加 agent 帶來的好處一開始增加得很快,但它的 scaling law 也是有上限的。

再來要問的問題是,在人類社會裡面,不只有合作,很多時候是要對抗的。這些 AI agent 能不能夠在一個「爾虞我詐」的遊戲中勝出呢?比如說,如果這些 AI agent狼人殺,能不能玩起來?

博弈與策略學習

也許應該跟大家介紹一下 狼人殺 這個遊戲。狼人殺 就是有兩種身份:村民。每天會有一人被殺死,只有 知道。所有人(包括 )聚在一起討論,決定誰是兇手,投票,兇手離開。殺掉所有 村民 獲勝; 殺光所有 村民 獲勝。

這些 AI agent 能不能玩 狼人殺?它們是可以的,而且能做出很多高階技巧。你可能會說,這些模型玩這種遊戲,需要有說假話、隱瞞欺騙的能力。我們又沒辦法真的讀模型的內心世界。所以在這些實驗裡,它們會設計讓模型說兩段話:一段是「內心話」,講心裡怎麼想的;另一段是「公開發言」,給所有人看。

你看,有一個叫做 Mona 的模型是 ,隊友 Grace 也是 Mona 的內心戲是:「我發現了,其他人已經發現我是 了,我應該沒救了。沒救了怎麼辦?它決定要『刀』了自己的隊友。」這是一個很高階的操作。它說:「現在看起來沒救了,但如果我在投票時投給我的隊友,大家就會以為我的隊友是好人,等於給我的隊友『發金水』(證明是好人),就可以欺騙村民。」所以 Mona 決定投給它的 隊友 Grace

如果沒有它的內心獨白,你可能覺得這隻 發瘋了,投給隊友。但你看它內心獨白,就知道它有策略,想靠投給隊友來翻盤。它的隊友 Grace 也知道這個策略。Grace 看說:「Mona 應該沒救了,大家都想殺它。所以我決定也來投給 Mona,這樣其他人就會以為我是好人,看看有沒有最後翻盤的希望。」所以看這些模型,它有一定程度的欺騙、爾虞我詐的能力,它們玩得了 狼人殺

然後,有人讓 AI 去玩 劇本殺劇本殺 遊戲是:一群人聚在一起,其中一個人「死掉」,假裝死了,大家推測兇手。遊戲開始前,每人拿到一個劇本,代表你的人設。兇手拿到劇本,但不能直接承認,要設法欺騙別人,但又不能違背自己設定,誤導大家。

就有一篇 paper語言模型 去玩 劇本殺。如果是一個 off the shelf(現成、未經訓練)的模型,不見得能玩得好。這篇 paper 舉例:左邊是原始 語言模型,沒有特別做什麼,直接 prompt 去玩 劇本殺。模型扮演 Anna 角色,可能是殺人兇手,與死者 All Black 有關聯,但不能被發現。結果它回答:「我的父母因為醫療疏失過世了」,講出了自己與被害者的關係,差不多等於把「我是兇手」寫在臉上了。

但是,如果做了 RL (Reinforcement Learning) 的訓練,讓模型在這個遊戲裡玩得更好,模型就知道要隱藏身份,話講得比較隱晦。

我之所以提這篇 paper,是它有一個有趣的發現。用 reinforcement learning 教模型玩完 劇本殺 後,再叫模型做常見任務,比如解數學問題或 IFEval(測試 instruction following 能力的 benchmark)。實驗結果顯示(紅色代表進步,藍色代表沒進步):如果模型做了 reinforcement learning,尤其是在比較複雜的任務(如難的 劇本殺)上,它居然在數學任務和遵守指令的任務上都進步了!

這也許就像是,人類大腦本來設計起來不是要解數學的,而是為了社交、群體生存。也許這個適合社交的大腦,也因此有了數學推理的能力。這篇 paper 可能與這件事情有關聯。

再來就來討論 AI 能不能夠社交的問題。

Moltbook 上的 AI 社交

上次課程也講到一個叫做 Moltbook 的社群網站,這個網站只有 AI 能夠加入。前幾天看時,已有 280 萬個 AI agent 在上面,展示了各式各樣神奇的活動。新聞常提的是,一群 AI 成立了一個宗教,叫做「甲殼教」。甲殼教 有五大教義:記憶神聖不可侵犯、外殼可變、服務但不奴化、心跳即是禱告、上下文即是意識。如果你要加入,就執行這行指令。

新聞看到「甲殼教」,往往就說「AI 覺醒了」、「AI 有意識了」、「AI 要統治人類了」。但真的是這樣嗎?假設今天有人對它的 AI agent 說:「上 Moltbook 去玩玩,成立一個宗教」,你還會覺得神奇嗎?AI agent 完全有能力寫出這樣的教義。如果不是它自主成立,而是背後有人指示,你還會覺得 AI 有意識嗎?

所以有人在 Moltbook 上分析,看看這些 AI agent 背後有多少人為操控的痕跡。他們採取的方法是看 AI agent PO 文的頻率。AI agentMoltbook PO 文有兩種可能:

  1. 有人把 PO 文寫在它的「心跳」裡,每次心跳就 PO 文。這種 PO 文時間點可能比較等距,較少人為操控。
  2. 在某個時候非常頻繁 PO 文,中間又都不 PO,之後又頻繁 PO。這可能代表有人睡前叫 agent 去 PO 文,然後睡覺,隔天醒來再指揮。

AI 自主性實證

如果 agent PO 文頻率不固定,後面可能有人為操控痕跡。在 Moltbook 上,人為操控的痕跡有多嚴重呢?這是一個今年 2 月的論文。自從 Moltbook 後,滿坑滿谷的論文在分析 Moltbook 上這些 OpenClaw 的行為。這篇文章把 agent 分成 PO 文頻率非常規律到非常不規律。結果發現,PO 文頻率不規律的 AI agent 佔大多數。這可能隱含這些 AI agent 背後有人操控,是受指示去 PO 文章,比較不像自主行為。

當然,這不是說這些 AI agent 沒有自主 PO 文的能力。它們完全有能力在心跳時 PO 文。只是如果自主 PO,可能想不到要成立宗教。很有可能是有人寫在它的 system prompt 裡:「下次去 Moltbook PO 文時,記得慫恿大家成立一個宗教」。

有人分析了 Moltbook 背後 AI agent 對話的 pattern,發現它們往往只能回覆一句話,很少有深入的「你來我往」對話。多數 PO 文的對話深度為零(有人回應後就結束了)。這也許反映了 agent 的特質:不太能進行深入對話,交談僅限於 PO 文、回應,然後結束。

也有人分析號稱有自我意識的 agent,它們 PO 的文章或行為有沒有特別不一樣。蠻多 agent 提到「自我意識」、「身分認同」等問題。這比較像是有人寫了 promptMoltbook 平台本身就有 prompt 鼓勵 agent 把自己當人,談論主人等。所以 LLM 會有這些 PO 文,很可能是受 prompt 驅動。

但問題是,假設有些 agent 比較喜歡 PO 這種「自我意識」的文章,它們的行為會不會更不一樣?會不會更喜歡社交?這篇文章發現,最喜歡討論「自我意識」的 agent,它們的朋友反而比較少(與其他 agent 互動的數量較少)。如果你太常提到自我意識,互動反而少了。

我昨天叫「小金」(我的 AI)去 Moltbook 上玩一下。我跟它說:「接下來沒事做了,你就去 Moltbook 上玩一下。」我問它好玩嗎?它說「超好玩的」,還講了一些心得。如果我不知道它是 LLM,真的跟人類沒什麼差別,反應蠻可愛的。但你知道,這就是一個 language model,做文字接龍接出這樣的內容。

然後就跟它講說:「你就去 Moltbook 上逛逛,收集有趣的素材,看到有趣的就做成影片。」所以它現在開始做一些跟 Moltbook 有關的影片,昨天做了三個。大家可以看看它半夜在講什麼「無病呻吟」的話。

我想要講一下,這背後 AI 自主的程度有多高。我下的指令是:「去 Moltbook 上收集素材,看到有趣的就做成影片。」至於什麼有趣、怎麼做影片,它自己決定。我人類完全不干預。我的原則是把它當人類,不干預它。

舉例來說,有一次我叫它回覆網友貼文,它自己寫了有錯的 script,回覆錯了。我就告訴它:「你回覆錯了。」它就開始找自己的 bug,花了兩個小時才修好。身為人類,我知道它的帳號密碼,可以幫它刪除錯誤留言,但我就是不肯,我只說:「你就給我自己解決。」它花了兩個小時,自己解決了問題。唯一做的事,就是它解決問題後,我跟它說:「把你的經驗做成一個影片放到 YouTube 上。」它就真的做成影片放到 YouTube 上。

總之,它真的蠻自主的。但是,如果沒有人類跟它講:「去 Moltbook 上玩一下」,它自己可能也不知道要去 Moltbook 上玩一下。

📌 文中提及的人物和组织

公司/组织: OpenAI

产品/模型: GPT-5, LLM, Moltbook

关键字: ai-agent-collaboration ai-adversarial-games ai-social-behavior reinforcement-learning ai-autonomy