Grok 4.7釋出,強化長任務和自我檢查

9月21日,SpaceXAI釋出Grok 4.7,稱其採用更大的基礎模型,並加強了困難長任務及驗證方面的訓練。
GitHub同日宣佈在Copilot逐步推出。開發方基準成績受測試及推理設定影響,不能據此認定它在所有工作中都更強。
本報觀點
速度應看完成工作,而不只是回覆快
持續工作和自我驗證需要一起看。回覆很快但每次都要人修,工作並不會更早結束。執行中發現錯誤,可能減少反覆叫人回來的次數。
因此,值得比較的可能是交出任務後人還需要投入多少分鐘。競爭可能轉向能否可靠地節省人的注意力。
今後生活可能怎樣改變?
以下是根據這則新聞作出的未來設想。
把任務交出去,專注另一件事
未來,個體經營者可以交出網站修復任務後專心接待顧客,讓AI推進修改和檢查,再彙總需要人決定的問題。
這並非該模型保證實現的結果,而是在設想:當人不必持續盯著委託任務時,工作方式會如何改變。

