2026 年 8 月 6 日,在 Google 工作近 27 年的首席科學家 Jeff Dean 將與 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 創立 Discovery Loop。這家新創的目標,是自動化科學與工程中的實驗循環,讓 AI 從提出假設、執行實驗到評估結果,都能更快完成。
這項動向讓他在 7 月 30 日刊出的談話多了一層意義。
Jeff Dean 曾參與打造 MapReduce、Bigtable、TensorFlow 與 TPU,也是 Google Brain 共同創辦人。Y Combinator 當天刊出他以 Google 首席科學家身分出席 Startup School 2026 的訪談。他在其中談到兩件事:AI 是否已具備初級工程師的能力,以及小團隊要如何避開被通用模型吞掉的命運。
這兩個問題其實指向同一場產業戰役。當基礎模型快速擴張能力邊界,工程師要重新定義自己的工作,AI 新創也必須證明,產品不會在下一次模型升級後失去價值。
AI 已達初級工程師?答案藏在「如何定義」
Jeff Dean 在 2025 年曾預測,一年左右將出現能全天候工作的「虛擬初級工程師」。一年後被問到預測是否命中,他的回答是:若依特定方式定義初級工程師,這項預測「相當準確」。他認為,模型處理代理式、長時間程式任務的能力,成長得比自己原先預期更快。
Jeff Dean 認為,真正的變化不只是 AI 會寫幾段程式碼,而是代理式系統已能承接更複雜、執行時間更長的任務。在部分問題領域,只要底層模型能力足夠,AI 甚至可以持續工作數天或數週。
他以軟體重寫為例。企業可以要求 AI 將既有軟體改用另一種程式語言重新實作,再透過原有測試逐一比對行為差異。這類任務之所以適合 AI,不只是因為模型會寫程式,更重要的是既有程式與測試已提供非常清楚的規格。
這也說明 Jeff Dean 所稱的「初級工程師」,並非單純能夠生成程式碼,而是能理解任務、操作工具、執行測試,並在較長流程中逐步完成工作。當這些能力開始被代理系統整合,初級工程師原本負責的部分執行工作,確實可能率先被改寫。
任務拉長後,錯誤會在第 10 步開始累積
Jeff Dean 也沒有迴避 AI 代理的弱點。他在訪談中指出,代理有時在使用工具約 10 次後就開始失準。當任務逐漸離開模型熟悉的範圍,表現可能快速下滑;流程越長,早期的小錯也越容易一路放大。
他的解法是把更多工程資源放到模型周邊。第一步是為 AI 撰寫「技能」,清楚說明如何操作特定工具、讀取紀錄或執行測試。第二步是讓多個代理嘗試不同路徑,再交由另一個模型評估哪些方案值得保留。最後,系統必須持續用測試或指標檢查結果,而非讓代理一路做到結尾才驗收。
這也解釋了為何 Jeff Dean 看重「上下文工程」。模型只是系統的一部分,真正的產品還包括資料檢索、歷史紀錄、工具、記憶與評估流程。白話說,模型像一名能力很強、但對公司一無所知的新員工;企業若沒有提供文件、權限、操作規則與驗收標準,再強的模型也只能不斷猜測。
「1% 法則」:模型成功率達 20%,反而可能太晚進場
對 AI 創業者而言,訪談裡最務實的建議,是尋找通用模型成功率只有 0% 至 1% 的問題,而非已能勉強完成 20% 的問題。
Jeff Dean 的判斷是,若通用模型已經能做出一部分,代表這項能力可能正在形成。隨著訓練資料增加、模型規模擴大,半年至一年後,基礎模型可能直接涵蓋這項功能。創業團隊辛苦打造的產品,就會被模型供應商的一次更新吃掉。
成功率只有 1% 當然不保證商機。模型完全失敗,也可能代表問題沒有需求、缺乏可取得的資料,或根本無法建立可靠的評估方式。Jeff Dean 把「是否真心想解決,而且對世界有用」列為第一項選擇標準,1% 法則則是第二道篩選,用來檢查產品是否擁有足夠長的技術領先期。
這套法則揭露了 AI 創業最難拿捏的取捨:問題若太容易,基礎模型很快追上;問題若完全做不到,團隊可能把資金耗在沒有出口的研究上。 較好的切入點,是通用模型幾乎失敗,但團隊手上的資料、領域知識或評估方法,足以把成功率一步步推高。
他提出兩條較可能形成持久優勢的路徑。其一是掌握通用模型看不到的資料,例如個人資訊或企業內部流程;其二是針對材料科學、晶片設計等狹窄領域,利用專有資料與特定模型做到更高準確率。小團隊不必在所有能力上擊敗 Google,只要在一個高價值問題上,把資料、工具與使用流程組合得更好。
程式越容易生成,「選對問題」反而越稀缺
AI 接手更多寫程式工作後,人類的價值不會自動消失,但會往任務上游移動。Jeff Dean 舉例,把 Python 程式轉成 Go,已是模型相當擅長的工作,原因是原始程式與測試本身就是詳細規格。相反地,若只給一句模糊需求,模型就得自行猜測,錯誤空間也隨之放大。
因此,他認為更稀缺的能力將是「品味」:決定哪些問題值得解、寫出清楚規格,並判斷結果是否真的有用。 這也是「AI 取代初級工程師」最容易被忽略的一面。若企業只移除入門工作,卻沒有讓新人參與規格設計、測試與程式審查,未來也可能失去培養資深工程師的路徑。
Discovery Loop 所押注的方向,正是把這套方法擴大到科學與工程。Jeff Dean 預測,AI 將能自行拆解問題、執行大量實驗,再把結果組合成下一輪方案。但在可驗證的實驗之外,什麼問題值得投入、錯誤代價能否承受,仍需要人類做決定。
更合理的分工是:先由人寫清楚問題,再讓 AI 加速執行;先建立驗收機制,再拉長自主工作時間;最後才判斷哪些流程可以真正交出去。 初級工程師的工作內容可能被大幅改寫,但「會產生程式碼」與「能對工程結果負責」之間,仍有一段不能省略的距離。
資料來源:Y Combinator/Root Access 訪談逐字稿、紅杉資本 Training Data Podcast、《Axios》、Epoch AI MirrorCode 研究、METR 方法限制說明
本文初稿為AI編撰,整理.編輯/ 李先泰
