找报告

计算机行业:微软新工作的未来2025年报告

时间:2025-12-23

作者:詹娜·巴特勒,索尼亚·贾菲,Rebecca Janßen,南希·贝姆,布伦特·赫克特,杰克·霍夫曼,肖恩·伦特,巴哈尔·萨拉夫扎德,阿比盖尔·塞尔恩,米哈埃拉·沃罗维雷亚努,杰伊米·蒂夫恩,穆罕默德·阿索拜,莉兹·安克拉,斯蒂芬妮·比尔兹,梅根·贝宁,米娅·布鲁赫,扎娜,布钦卡·马卡尔帕内利,阿米莉亚·科尔,斯科特·库恩斯,玛德琳·戴珀,贾斯汀·爱德华兹,亚历克斯·法拉奇,丹·戈德斯坦,玛丽·L·格雷,布伦特·赫赫特,哈维尔·赫纳雷斯,埃里克·霍洛维茨,妮可·伊莫里卡,科里·英佩恩,尚西·伊克巴尔,索尼娅·贾菲,马纳萨·贾加迪什,丽贝卡·扬森,辛·林利,布兰登·卢西尔,尼克·马奎德特,梅西·穆卡伊,安布里塔·南德,亚历山德拉·奥尔泰努,杰克·奥尼尔,马克斯,彼得施密特,克里斯蒂安·普利茨,拉比扎,娜塔莉·里奇,肖恩·林特尔,阿代夫·萨卡,巴赫尔·萨拉夫扎德,苏娜亚娜·西特拉姆,阿曼达·斯内林格,金娜·苏,约翰·唐,列夫·塔涅列维奇,杰迈亚·蒂凡,基兰·汤林森,安妮·特拉帕索,亚当·特洛伊,高rav·韦尔马,米哈埃拉,Vorvoreanu,杰克·威廉姆斯,约达娜·杨,本·兹翁

可扩展的测试时计算框架获得了关注,支持开放权重达到IOI2025金牌水平的模型,显示可重复“更多计算→更高分数”曲线在竞赛编程中。(萨马达等,2025)。 长时程任务完成能力正可测量地加速。METR的50%任务完成时间时程显示,前沿智能体的可靠任务长度已呈指数级增长,具有~7个月的倍增时间。将“代理进度”转化为具体的效能趋势(Kwa等人,2025年)。 可验证强化学习(RL)的微调后训练(奖励正确、可检查的结果)即使在从没有任何标记推理痕迹的基础模型开始时,也能在困难的数学/编程风格任务上获得显著提升。(DeepSeek-AI等人,2025)。 多回合强化学习用于工具使用/搜索代理现在通过从更长的行动视程中学习经验,已经超越了仅使用提示的基线;在一个法律文档搜索基准测试中,一个经过强化学习训练的14B代理报告了85%的准确率,而前沿级模型的准确率为78%,并且当允许更多回合时,准确率还有额外提升。(Kalyan & Andrews, 2025)。 多模型路由+聚合正从一次性的“选择一个模型”转变为通过强化学习训练的序列策略,该策略能够思考、调用多个模型并整合响应,同时显式优化性能-成本权衡——在多跳问答风格的评估中提升结果。(张等人,2025)。

页数

74

格式

pdf

大小

5848 KB

更新时间

2026-04-13