冻结实例
题面、素材、时区、初态与允许操作,先确定可比条件。
把手机 Agent 放回真实生活。
观察每一步,核验每一个结果。
AndroidBench 连接任务、轨迹与核验。探索豆包和 GAgent 在同一台实体手机上的表现,理解它们在哪里做对,又在哪里偏离。
订单去重 / 退款状态
字段引用 / 原件读回
任务规格 64 历史 + 64 新增
生活领域 四个独立分类维度
双产品先导对照 同一实体手机 · 8 次运行
GAgent 开发回归 设置目标均已读回确认
四个冻结实例,逐项核验。
这是先导比较,不是总体排行榜。
正在读取已核验结果…
按用户目的归入八个领域。
能力、挑战和实验资格独立记录。
展开同题两种路径,查看实际画面与附件。
过程由可见记录整理,未获得豆包隐藏推理。
阶段对照不代表时间同步。画面为未经重绘的精选截图;文字是研究者对公开过程及存储记录的整理。播放按钮按阶段翻阅,非连续录屏。
运行中的 GAgent 进度浮窗覆盖了目标。相同坐标、相同手势:浮窗可见时值不变,收起后变为两分钟。
受控复现让问题从“点不动”变成可解释的交互缺陷。通用修复方向是目标避让、观察版本校验,以及始终可达的取消入口。
题面、素材、时区、初态与允许操作,先确定可比条件。
记录模式、公开过程、界面状态、人工介入与停止原因。
真实文件按原字节取回,系统设置独立读回,保留未知项。
独立 Monitor 检查证据和口径,核对无关状态并恢复设备。
以上为内部研究档案规模。本站公开经审阅的17张截图、4组轨迹摘录和6份实际附件;完整设备记录不直接公开。
没有。64条为历史题面,新增64条为开发规格;本轮执行的是四个冻结实例的双产品先导与三次GAgent开发回归。未物化fixture与reset的规格不计作可执行实验。
同题、同实体手机,仍有产品权限、会话历史和观察深度差异。三个工作题使用固定事实,主要检验约束处理及交付。样本不足以推出总体排名、稳定速度优势或完整跨App能力。
部分观察器从准备开始计时,豆包日程严格第300秒状态未知;报销视口也未跟随最新结果。当前记录不适合放进统一性能排行榜,相关时间只作带来源的观察。
豆包仅有公开界面过程,未取得隐藏云端推理或私有参数。GAgent部分存储调用参数和结果原本已截断。不能从没有记录推断没有动作,也不能补写缺失过程。
逐领域物化素材、初始化与重置,加入人类参考执行、匹配重复和严格提交时钟。按语义题族隔离保留集,同时报告领域宏平均与任务微平均。