比特思想實驗室
財經創業成長AI ToolsAbout Me
比特思想實驗室
© 2026
首頁AI Tools@matthew_berman為什麼 SWE-bench 已經不夠看了?它根本在考「開卷考古題」

為什麼 SWE-bench 已經不夠看了?它根本在考「開卷考古題」

AI Tools@matthew_berman2026年5月28日7 分鐘閱讀
DeepSWESWE-benchAI編碼基準測試軟體工程

你上一次興致勃勃地看著某個 AI 模型在編碼基準測試中「屠榜」是什麼時候?可能是昨天,也可能是幾小時前。我們已經習慣了這種節奏:一個新模型發布,宣稱在 SWE-bench 上拿下驚人分數,然後社群狂歡,接著下一週又被另一個模型超越。但你有沒有想過,這些測試到底在測什麼?它們真的能反映 AI 在真實世界寫程式的實力嗎?還是說,我們一直在被一個精心設計的數字遊戲矇騙?

今天,我們要聊的這個新基準測試,很可能會顛覆你對「AI 寫程式」的所有認知。它叫做 DeepSWE,由一位開發者打造,並在 Matthew Berman 的頻道上被稱為「終於出現的好基準」。這不是又一個讓模型刷榜的玩具,而是一面照妖鏡,專門用來揭露那些「考試型選手」的真面目。準備好迎接一場關於 AI 能力的殘酷真相了嗎?

為什麼 SWE-bench 已經不夠看了?它根本在考「開卷考古題」

在進入 DeepSWE 之前,我們得先搞清楚它為什麼被需要。過去一年,SWE-bench 幾乎是所有 AI 編碼模型的聖盃。它包含 2,294 個來自真實 Python 專案的 GitHub Issue,模型得看懂問題、修改程式碼,最後讓測試通過。聽起來很合理,對吧?

但問題出在「數據污染」這四個字。這些 Issue 都是公開的,而且很多已經存在了好幾年。模型在訓練時,極有可能已經「看過」答案。這就好比你讓一個學生去考一份他早就做過的考古題,他當然能拿滿分,但你敢讓他去解決一個全新的 bug 嗎?

更糟的是,SWE-bench 的評分方式也有漏洞。它只看最終的測試結果,不看過程。模型可以靠著暴力搜尋、隨機嘗試,甚至「作弊式」地複製貼上網路上已有的解答來過關。這導致了一個荒謬的現象:有些模型在 SWE-bench 上分數很高,但在實際開發中卻連最簡單的任務都搞不定。

DeepSWE 的出現,就是為了終結這場鬧劇。它不再考「考古題」,而是直接出「新題」。它從真實的 GitHub 專案中,提取出那些從未被任何模型解決過的最新 Issue,並且在設計上就杜絕了模型靠記憶力答題的可能性。這不是一場開卷考試,而是一場真正的實力測驗。

DeepSWE 的殘酷規則:你寫的程式碼,必須像真人一樣被審查

那麼,DeepSWE 到底厲害在哪裡?它的核心設計只有一句話:模擬真實的軟體開發流程。它不只是看模型能不能通過測試,而是看它能不能像一個真正的工程師一樣,有邏輯、有步驟地解決問題。

具體來說,DeepSWE 建立了兩個層層遞進的關卡:

  1. 複現 (Reproduction):模型必須先根據 Issue 的描述,寫出一個能重現 bug 的腳本。這一步非常關鍵,因為如果連 bug 都無法重現,代表模型根本沒看懂問題。這就像醫生連病人的症狀都搞不清楚,就急著開藥方,完全是在瞎矇。

  2. 修復 (Fix):通過複現關卡後,模型才被允許修改程式碼。但重點來了,它的修改過程會被全程記錄,包括它看了哪些檔案、修改了哪些行、嘗試了哪些錯誤方向。評分時,不是只看最終結果,而是會綜合評估它的「解題思路」是否合理,程式碼風格是否乾淨,有沒有引入新的 bug。

這還不是最狠的。DeepSWE 還引入了一個名為 「一致性檢查」 的機制。它會讓模型多次嘗試解決同一個問題,如果每次給出的答案都不一樣,那就代表模型只是在「瞎猜」,而不是真的理解。一個真正可靠的 AI 工程師,應該要能穩定地產出高品質的解決方案,而不是像個抽獎機一樣,時好時壞。

這套規則直接打中了當前 AI 模型的軟肋。很多模型擅長「一次通關」,但經不起反覆推敲。DeepSWE 就像一個嚴格的程式碼審查員,它不在乎你寫得多快,只在乎你寫得多好。

真實世界的震撼彈:頂級模型的慘敗

當 DeepSWE 的開發者把這個基準測試套用在當前最頂尖的模型上時,結果令人震驚。那些在 SWE-bench 上叱吒風雲的模型,在 DeepSWE 面前紛紛現出原形。

根據 Matthew Berman 在影片中揭露的初步數據,目前沒有任何一個模型能在 DeepSWE 上取得超過 30% 的得分。對比它們在 SWE-bench 上動輒 60%、70% 的成績,這個落差簡直是災難性的。

「我們發現,許多模型在 SWE-bench 上的高分,其實是建立在對訓練資料的記憶之上。一旦面對全新的問題,它們的表現就跟隨機猜測差不多。」——DeepSWE 開發者

舉個例子,某個號稱「最強程式AI」的模型,在 SWE-bench 上拿下了 68% 的成績,但在 DeepSWE 的複現關卡中,成功率直接暴跌到 15%。這意味著,它連問題都看不懂,更別提解決了。這就像一個學生,平時模擬考都考第一名,但一到真正的大考就完全失常。原因很簡單:他一直在刷題,但從未真正學會解題。

這組數據給整個 AI 編碼領域潑了一盆冷水。它告訴我們,目前所有公開的標竿測試,可能都嚴重高估了 AI 的真實能力。我們離「AI 取代工程師」的願景,可能還有很長一段路要走。

為什麼這對你很重要?因為你正在被「假分數」欺騙

你可能會想:「我又不寫程式,這跟我有什麼關係?」關係可大了。DeepSWE 的出現,不只是打臉了幾個 AI 模型,它實際上揭露了整個 AI 產業的一個結構性問題:我們過度依賴不可靠的標竿測試來評估 AI 的進步。

想想看,從 GPT-4 到 Claude 3,從 Gemini 到 Llama,每一次新模型的發布,我們看到的都是「在 XX 基準上提升 YY%」的新聞標題。但這些分數,有多少是可信的?有多少只是模型在訓練資料中「看過」的答案?

這不僅僅是學術界的問題。企業在決定是否導入 AI 工具時,往往會參考這些標竿數據。如果這些數據是虛胖的,那企業的投資決策就可能出錯。個人開發者在選擇 AI 助手時,也可能因為被這些分數誤導,而選到一個「考試型」而非「實戰型」的工具。

DeepSWE 就像一個市場上的「吹哨者」,它用自己的方式告訴我們:別再被那些漂亮的數字騙了,真正的實力,只有在面對未知的挑戰時才能展現。

未來該怎麼走?我們需要更多「DeepSWE」

DeepSWE 的出現,無疑是 AI 評測領域的一次重要進步。但它只是一個開始,而不是終點。它的真正價值,在於為我們指明了一個方向:我們需要更多像 DeepSWE 這樣,能真正反映真實世界複雜性的基準測試。

這不僅僅是針對程式碼領域。在醫療診斷、法律諮詢、金融分析等所有 AI 應用的領域,我們都需要類似的「照妖鏡」,來揭穿那些華而不實的模型。

對於科技愛好者和從業者來說,我們應該從 DeepSWE 的案例中學到以下幾點:

  • 對任何標竿測試都要保持懷疑:不要只看最終分數,要了解測試的設計邏輯,以及它是否可能被「污染」。
  • 關注「過程」而非「結果」:一個好的 AI 模型,不應該只是給出正確答案,更應該能解釋它的思考過程,並能穩定地產出高品質的結果。
  • 擁抱「真實世界」的測試:與其相信實驗室裡的數字,不如親自去試用、去挑戰這些模型。只有親身體驗,才能真正了解它們的強項與弱點。

核心觀點速覽

項目SWE-bench (舊)DeepSWE (新)
測試題目公開的歷史 Issue (可能被記憶)全新的、未被解決的 Issue
評分標準只看最終測試結果看解題過程、思路、一致性
主要漏洞數據污染、暴力搜尋設計上杜絕記憶,著重推理
模型表現高分 (60-70%)低分 (<30%)
反映的能力記憶力與模式匹配真實的推理與解決問題能力

總結:AI 的「期末考」才剛開始

DeepSWE 的出現,就像是在 AI 編碼領域投下了一顆震撼彈。它戳破了那個由虛假分數構成的泡沫,讓我們看到了 AI 真正的實力邊界。這不是一個壞消息,恰恰相反,這是一個好消息。因為只有正視問題,我們才能真正進步。

對於我們這些旁觀者而言,這是一個重要的提醒:不要迷信任何一個數字,也不要輕信任何一個「最強」的稱號。AI 的進步是真實的,但它遠比我們想像的更艱難、更緩慢。真正的考驗,不在於模型能答對多少考古題,而在於它能否在充滿未知的真實世界裡,幫我們解決一個又一個從未見過的難題。

現在,當你下一次看到某個模型又在某個基準測試上「屠榜」時,請先問自己一個問題:這個測試,是 DeepSWE 嗎? 如果答案是否定的,那或許,你該保留一點你的掌聲。

上一篇

「他們正在對我們說謊」:AI 謊言、伊朗戰爭與創業家必須面對的真相

下一篇

我放棄了 PowerPoint——不是因為懶,而是因為它已經落伍了

目錄

目錄

中