Grok 4.7发布,强化长任务和自我检查

9月21日,SpaceXAI发布Grok 4.7,称其采用更大的基础模型,并加强了困难长任务及验证方面的训练。
GitHub同日宣布在Copilot逐步推出。开发方基准成绩受测试及推理设置影响,不能据此认定它在所有工作中都更强。
本报观点
速度应看完成工作,而不只是回复快
持续工作和自我验证需要一起看。回复很快但每次都要人修,工作并不会更早结束。执行中发现错误,可能减少反复叫人回来的次数。
因此,值得比较的可能是交出任务后人还需要投入多少分钟。竞争可能转向能否可靠地节省人的注意力。
今后生活可能怎样改变?
以下是根据这则新闻作出的未来设想。
把任务交出去,专注另一件事
未来,个体经营者可以交出网站修复任务后专心接待顾客,让AI推进修改和检查,再汇总需要人决定的问题。
这并非该模型保证实现的结果,而是在设想:当人不必持续盯着委托任务时,工作方式会如何改变。

