上個月,當 OpenAI 悄悄向一群選定的企業客戶推出其最新模型時,工程團隊的反應立即而一致:這是不同的。
與先前需要仔細提示和頻繁修正的迭代不同,新模型(內部代號為「獵戶座」)展示了工程師所描述的近乎不可思議的上下文理解水平。它不只是完成程式碼;它對架構進行推理,預測邊緣情況,並在被詢問之前編寫測試。
重寫規則手冊的基準
在程式碼產生的行業標準基準 HumanEval 上,Orion 得分為 97.3%,比之前的最佳水平足足高出 12 分。更令人印象深刻的是,在 SWE-bench(測試解決生產程式碼庫中實際 GitHub 問題的能力)上,它取得了 68% 的成功率,而其前身為 49%。
「我們已經在內部程式碼庫上運行它三週了,」一家大型雲端提供商的一位不願透露姓名的高級工程師表示。 “它不會取代工程師。但它使每個工程師的生產力提高了三倍左右。”
它是如何運作的
關鍵的架構創新似乎是 OpenAI 所說的「執行感知推理」——該模型維護了一個關於程式碼在運行時實際執行的操作的心理模型,而不是簡單地預測語法上合理的完成。這使得它能夠捕獲僅在運行時才會出現的邏輯錯誤,這種能力歷來是經驗豐富的人類工程師的專有領域。
該模型還引入了一個包含 200 萬個令牌的新上下文窗口,使其能夠同時在記憶體中保存整個大型程式碼庫。這意味著它可以在一個檔案中進行更改,並充分了解這些更改如何影響數十個依賴模組。
業界反應
開發者社群的反應既興奮又焦慮。在 Hacker News 上,有關該模型功能的帖子在 24 小時內吸引了 800 多條評論,意見範圍從“這是自 IDE 以來最重要的生產力工具”到“我們需要認真討論這對初級開發人員招聘意味著什麼”。
GitHub 執行長 Thomas Dohmke 一貫樂觀:“我們一直說 Copilot 是結對程式設計師,而不是替代者。我們現在看到的是結對程式設計師成為高級工程師。”
接下來會發生什麼
OpenAI 尚未宣布該模型的公開發布日期,但熟悉該公司計劃的消息人士表示,將在未來幾週內從 ChatGPT Enterprise 客戶開始分階段推出,然後為開發人員提供 API 存取。
對於已經使用它的工程團隊來說,問題不再是人工智慧是否會改變軟體開發,而是他們能夠以多快的速度適應一個瓶頸不再是編寫程式碼,而是知道要建立什麼的世界。
安全和代碼品質問題
並不是每個人都在慶祝。安全研究人員對人工智慧生成的程式碼引入了人類審查人員可能會忽略的微妙漏洞提出了合理的擔憂。史丹佛大學今年稍早發表的一項研究發現,使用人工智慧編碼助理的開發人員更有可能引入安全缺陷——不是因為人工智慧編寫了不安全的程式碼,而是因為開發人員信任人工智慧輸出,而沒有像他們對自己的工作那樣進行同樣的審查。
OpenAI 的回應是直接將安全掃描建置到模型的輸出管道中。當模型產生與已知漏洞模式(SQL 注入風險、不正確的輸入驗證、不安全的加密實作)相符的程式碼時,它現在會內嵌標記問題,而不是默默地產生有問題的程式碼。早期測試人員報告說,這可以捕獲相當大比例的常見安全錯誤,儘管它不能取代專門的安全審查。
對初級開發人員招募的影響
開發者社群的焦慮集中在這對入門級角色意味著什麼。從歷史上看,初級開發人員透過編寫樣板程式碼、修復簡單的錯誤並逐漸承擔更複雜的任務來學習。如果人工智慧處理所有這些工作,那麼傳統的軟體工程入口就會消失。
一些工程領導者提出了相反的觀點:人工智慧工具將使軟體開發在更廣泛的業務中在經濟上可行,從而為開發人員創造更多而不是更少的需求。一家 B 輪初創公司的一位工程總監表示:“以前買不起開發人員的小企業現在都可以構建軟體了。” “這並不是工作崗位減少,而是更大的市場。”
現實情況可能介於兩者之間。專注於日常執行的角色將會縮小。專注於架構、產品思維和人工智慧無法複製的人類判斷的角色將會增加。這種轉變將是不平衡的,適應最快的開發人員將是那些將人工智慧視為增強判斷力的工具而不是開發人工智慧的替代品的人。
企業採用模式
在已經測試該模型的企業客戶中,採用模式正在顯現。最高價值的用例並不是公開討論最多的用例。程式碼生成成為頭條新聞,但真正的生產力提升來自程式碼審查——模型能夠讀取拉取請求,不僅識別錯誤,還識別架構問題、效能影響和可維護性問題,而人類審查者在時間壓力下經常錯過這些問題。
文件產生是另一個很少成為新聞報導的高價值用例。讓文件與快速變化的程式碼庫保持同步是開發人員普遍討厭和普遍忽視的任務。該模型可以在最少的提示下從程式碼產生準確、可讀的文件——這項功能對任何工程團隊都具有直接、可衡量的價值。
定價和訪問
OpenAI 尚未透露新模型的定價,但產業分析師預計其在 API 定價層中的定位將高於 GPT-4o。對於企業客戶來說,價值主張很簡單:如果該模型使每個開發人員的生產力提高 3 倍,那麼即使每個代幣的成本很高,也很容易證明是合理的。更有趣的問題是,該模型是否可以以對小批量用例具有經濟意義的價格提供給個人開發人員和小型團隊。
進一步閱讀
- OpenAI Research — official model papers and technical reports
- OpenAI Evals — the open-source benchmark framework used to measure model performance
- SWE-bench — the real-world software engineering benchmark referenced in this article
- Stanford — Security vulnerabilities in AI-generated code: peer-reviewed research findings