
一夜之間,一個只有630行代碼的開源項目,讓整個AI圈開始嚴肅地討論"奇點"是否已經悄然來臨。
OpenAI聯合創始人、特斯拉前AI總監Andrej Karpathy近日在GitHub上發布了名為autoresearch的開源框架,核心理念極其直接:讓AI智能體在你睡覺時,自主完成上百次機器學習實驗,醒來就能收到一個更聰明的模型。
項目甫一發布,便在GitHub上收穫近萬顆星,科技界對它的熱情,絲毫不亞於任何一次大模型發布。

一個睡前啟動、醒來收穫的研究機器
autoresearch的工作邏輯可以用一句話概括:給AI一個真實但精簡的LLM訓練環境,讓它自己折騰。
智能體讀取研究人員用Markdown寫下的高層指令,隨後自主修改訓練腳本,包括調整神經網路架構、優化器參數或超參數設置,然後啟動一次固定時長5分鐘的訓練,根據驗證指標決定是否保留這次改動。
若結果變好,改動就通過git提交成為新基線;若沒有提升,則直接回滾,整個過程毫不含糊。這種"只進不退"的棘輪機制,確保了每一次迭代都是真實的進步,而不是隨機遊走。
每小時約進行12次實驗,8小時一覺醒來,就意味著近百個經過測試和評估的假設已經被逐一驗證完畢。

整個代碼庫的極簡主義是刻意為之的設計哲學。僅約630行Python代碼,三個核心文件,整個代碼庫恰好能完整放入現代LLM的上下文窗口中。這樣,智能體在修改代碼時始終能"看清全局",而不是盲人摸象般地局部修補。
"我不是ML研究員,但我學到的比跟了幾個月研究員還多"
這套框架的真實效果,很快得到了一位意外測試者的背書。
Shopify CEO Tobi Lütke看到項目後,當晚就將其部署到內部一個名為qmd的查詢擴展模型項目上。他指示智能體針對質量與速度進行優化,訓練數據來自Shopify內部的GitHub代碼庫。
八小時後他醒來,發現智能體已完成37次實驗,驗證分數提升了19%。更令人稱奇的是,那個經過智能體優化的0.8億參數模型,性能甚至超過了此前手工調優的1.6億參數舊模型。
"我當然不是機器學習研究員,"Lütke寫道,"但光是閱讀它一步步推演實驗過程就令人著迷,我從中學到的東西比跟隨ML研究員學幾個月還要多。"
Karpathy的回應一如既往地帶著他標誌性的幽默感:"誰能想到早期奇點會這麼有趣呢?"
人類的新工作:寫好那份Markdown文件
autoresearch最深刻的影響,或許不在於它跑了多少實驗,而在於它悄悄重新定義了研究人員的角色。

在這套框架里,人類不再需要直接編寫Python訓練代碼,而是轉為用自然語言撰寫研究方向、約束條件和優化目標。智能體是代碼的執行者與迭代者,人類是戰略的制定者與指揮官。工程師的核心技能,正在從"調參"轉向"提示詞工程",從操作具體工具轉向駕馭自主系統。
Karpathy在項目README中用他一貫的自嘲口吻寫道,代碼庫據稱已演化至第10205代,"沒有人能判斷這個說法是對是錯,因為'代碼'現在是一個自我修改的二進位文件,其規模已經超出了人類的理解範圍"。
這當然是一種戲謔,但戲謔之中藏著一個真實的問題:當AI持續數代地迭代改進自身訓練代碼,人類還能在多大程度上追蹤和理解這一過程?
Karpathy本人向來對"AI將全面取代人類研究員"的論斷持謹慎態度,他清醒地意識到AI在認知層面尚存在諸多局限。但autoresearch通過將系統約束在一個極為有限的封閉環境中,單一智能體、單一文件、單一指標、單一目標,繞開了大多數已知的局限性,讓智能體在這個受控的小世界裡表現出色。
這個周末項目,以一種低調但清晰的方式,示範了AI研究自動化的可能性。它不是終點,而更像是一個早期路標,指向那條人類與AI系統共同探索、彼此迭代的漫長道路。
作品聲明:僅在頭條發布,觀點不代表平台立場