腾讯自建Agent基準,結果自家CodeBuddy從未使用過Claude Code
2026-08-11 17:22:51
幣界網消息,騰訊自建了一套Agent基準workbuddy bench,測試其自家CodeBuddy和Claude Code的表現。260道真實工作題分為代碼、web、辦公和安全四類,7個模型各用兩套harness進行測試。結果顯示,Claude Code贏得了17組對比,而CodeBuddy僅贏得11組,代碼類測試中Claude Code完全勝出,成績為7:0。雖然CodeBuddy在web和辦公類中小勝4:3,但在安全類中則被Claude Code以4:3拿下。騰訊的排行榜也存在軟肋,每類題目仅有50到80道,社區對此提出質疑,認為增加難題可能會改變排名。
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。
關注HKWDB官方帳號,及時關注最新動態






