← 返回实习项目
INTERNSHIP / AI NATIVE BROWSER

Tabbit
让浏览器,真正理解并完成任务。

在 AI 原生浏览器 MVP 中,我参与输入与记忆、Agent 执行规则及评测闭环设计,让跨网页任务具备清楚的目标、材料范围和验收标准。

团队美团 · CN06-AGI 产品组
角色AI 产品经理实习生
时间2026.03 — 2026.06
工作重点输入与记忆 · Agent Loop · 评测
THE PROJECT IN A MINUTE

一分钟看懂项目

核心问题

用户在多个网页间反复检索、复制和核对,多步办公任务难以连续完成。

我的职责

参与输入与记忆设计、Agent Loop 和评测,推动字段规则、失败兜底与 Bad Case 迭代。

关键决策

收敛 MVP 与意图路由;关键字段先校验,缺失先澄清;执行设置停止条件,用分层评测定位问题。

结果

项目整体任务完成率 53.1% → 90.8%,结果采纳率 42.8% → 73.5%。

INTERACTIVE / PRODUCT WALKTHROUGH

一次任务,如何从失败走向可验证?

选择一种异常,逐步查看诊断、规则调整与回归检查。

流程示意 · 基于项目规则重建,可操作但不连接真实产品。示例内容与执行状态仅用于讲解,不是线上日志或实验数据。

正在准备交互演示。完整项目叙述与真实实验结果可继续向下阅读。

Tabbit 浏览器首页
Tabbit · 统一任务入口
01 / CASE STUDY

从打开网页,到完成一件事。

白领在检索、对比资料和多步办公任务中,经常需要在多个网页与文件间切换,再手动复制、整理和核对。Tabbit 希望把这些割裂的动作收敛到浏览器内,让用户用自然语言发起目标,由 Agent 理解材料并推进任务。

我的工作重点

我主要参与输入与记忆设计、Agent 执行循环和评测:梳理意图与字段规则,设计澄清和异常路径,与算法、研发对齐验收指标,再根据 Bad Case 推进迭代。

我如何与团队协作

我从产品侧对齐用户目标、执行规则、体验与验收口径;与算法和研发协作,将这些要求落到解析能力、接口和执行框架中。

02 / CASE STUDY

先收敛边界,才能跑通闭环。

我参与收敛首版范围:保留地址栏、标签页、收藏等熟悉的浏览器能力,用统一输入框承接访问、搜索、材料理解和复杂任务。关键是让入口简单,同时给后台链路明确的分流与停止条件。

IN

首版重点支持

自然语言统一入口;当前网页、选中文本与指定标签页引用;多网页理解与对比;复杂任务拆解、执行、校验和结果交付。

OUT

首版暂不扩展

全场景自主操作、本地生活交易闭环、MCP 外部工具市场和系统级桌面控制。高风险外部动作保留用户确认点。

Tabbit · 统一输入入口 · 点击放大
03 / CASE STUDY

先理解目标,再选择正确的材料。

四类意图,匹配不同处理成本

我参与收敛过细的输入路由,让访问和轻量问答走短链路;需要多步推进、工具调用和反复验证的任务,才进入执行循环。这样既控制处理成本,也让异常更容易定位。

意图典型请求(示例)产品处理重点
访问网页打开指定网站识别目标域名,保证准确与快速。
搜索信息找一份行业报告检索多来源信息,识别相关性与时效。
理解材料 / 问答总结这个网页明确引用对象,基于材料完成理解。
复杂任务比较多份资料并整理成表格补齐目标与约束,进入任务规划和执行。

把模糊表达转成可执行字段

我参与梳理输入链路的必填与可选字段,包括任务对象、材料范围、输出格式、时间要求和风险信息。关键字段缺失时,先检查已有上下文和记忆,仍无法补齐才向用户澄清;对混合意图则拆分子任务,明确先后依赖。

用户表达意图与字段识别上下文 / 记忆补齐必要澄清路由到对应链路

上下文选择与冲突处理

材料范围由任务决定

优先使用选中文本、当前页和用户明确指定的标签页;上传文件作为主动提供的材料。不会因为浏览器能够访问,就默认读取全部历史与后台页面。

保留信息来源与关键字段

解析材料时保留正文、来源、日期和任务必需字段。长材料按任务提取相关片段,需要全局理解时再使用临时材料索引。

当前确认优先于历史偏好

区分当前明确表达、短期任务状态与长期偏好。发生冲突时优先采用用户当前确认的信息,仍有歧义则澄清。

记忆服务于任务连续性

任务内记忆复用已完成结果,项目记忆支持跨轮次推进,偏好记忆辅助表达方式。避免反复读取、重复提取与无效重做。

Tabbit · 上下文引用与材料选择 · 点击放大
04 / CASE STUDY

让每一次执行,都有下一步和终点。

我参与设计从任务解析到重新规划的执行 Loop,并把每一步的关键字段和阶段目标纳入校验。输入明确后先拆解依赖,再调用工具;执行后根据校验结果决定继续、重试、换路或停止。

任务解析步骤拆解工具调用结果校验完成 / 重新规划
节点需要明确的规则面向用户的价值
任务解析目标、材料、约束和交付格式结构化减少任务理解偏差。
规划执行确定步骤依赖与工具输入输出复杂任务能够按顺序推进。
结果校验检查必填字段、返回状态与来源避免“看起来完成,实际缺项”。
重新规划临时失败原节点重试;路径无效则换源或换路保留已完成结果,减少从头重做。
结束与兜底达到目标结束;达到上限或持续缺失则解释失败避免无限等待和强行生成。

工具失败,也需要有产品体验

区分失败来自哪里

分别记录未触发调用、接口调用失败、返回内容缺失与所选工具不合适。不同类型需要不同修复方式,不能统一归因为“模型不好”。

确定性规则优先校验

必填字段是否存在、返回是否成功等问题可用规则检查;语义理解和方案判断由模型承担。工具输出还需核对来源和时效。

05 / CASE STUDY

把“答案不对”,拆成可以修复的问题。

我参与搭建 600 条、6 个任务层级的内测集,以及 120 条对抗样本。普通样本用于检验高频任务的可用性,对抗样本集中暴露意图歧义、上下文冲突、材料或字段缺失、工具失败及高风险动作。

测评层级观察什么对应迭代动作
意图与规划分类是否准确,步骤是否完整调整分类、字段要求和提示词。
上下文是否引用正确材料,关键信息有无遗漏调整材料优先级、解析与结构化规则。
执行与工具是否在正确节点调用,失败能否回退优化触发条件、重试路径和兜底。
最终结果任务完成、格式满足与来源可追溯修订验收口径,补充新样本。

让评测形成可追踪的迭代闭环

运行样本节点日志多模型判断人工复核修订与回归

我结合分模块离线测评、多模型交叉判断和人工复核定位 Bad Case,把问题反馈到提示词、字段规则或工具调用链路,再通过相关样本回归检查修改是否有效。上线后,我结合后端日志、前端埋点和采纳行为,继续观察任务是否真正被用户使用。

场景复盘:多网页任务中的字段缺失与工具失败

在多网页对比和资料整理任务中,我重点关注“链路继续运行,但关键字段没有拿到”这类问题。我的处理重点是把失败拆到节点,再对齐校验与兜底规则。

1 / 定位:缺在输入,还是缺在执行?

我结合节点输出与人工复核,区分意图歧义、上下文冲突、必填字段缺失和工具失败;工具问题再拆成未触发、接口失败、返回不全或工具选错,避免所有问题都落到同一个提示词上。

2 / 调整:补齐字段,再决定能否继续

我参与定义必填与可选字段:先检查上下文和记忆,信息不足再澄清。执行后校验关键字段与阶段目标;工具失败按情况重试、换源或降级,同时设置循环上限与失败解释,避免缺项时仍宣称完成。

3 / 验证:回到对应类别的样本

我把这些问题纳入分模块离线测评,结合多模型判断与人工复核推进回归。验证重点是字段是否补齐、来源是否可追溯、失败是否按预期结束,再看完整任务能否通过验收。

06 / CASE STUDY

任务能完成,结果也要被采用。

Agent 任务完成率

优化前53.1%
优化后90.8%

+37.7 个百分点

结果采纳率

优化前42.8%
优化后73.5%

+30.7 个百分点

我用任务完成率观察核心链路是否可用,再用结果采纳率观察输出能否被用户接受;定位问题时,则继续下钻到意图、上下文与执行节点。

沿链路定位改善发生在哪里

指标优化前优化后变化
意图识别准确率78.4%94.6%+16.2 个百分点
上下文命中率64.5%91.8%+27.3 个百分点
Loop 完成率46.3%87.6%+41.3 个百分点
单步工具成功率58.7%89.4%+30.7 个百分点
幻觉率(越低越好)13.8%3.7%下降 10.1 个百分点
任务模式使用占比19.4%36.8%+17.4 个百分点

观察后续使用

Agent 任务用户的 7 日留存为 32.7%,轻量问答用户为 18.5%。这让我继续关注网页总结、竞品对比和学习资料整理等高频任务的稳定性与复用体验。

07 / CASE STUDY

可靠性,是 AI 体验的一部分。

产品设计要覆盖失败路径

输入、工具和材料都可能不完整。澄清、停止、失败解释和部分结果交付,决定了用户是否理解系统、是否愿意继续使用。

验收指标需要沿链路拆解

整体完成率说明“有没有完成”,节点指标说明“为什么没完成”。两者一起看,才能确定下一轮迭代优先级。

后续探索:把高频流程沉淀为“妙招”

我从场景分布中识别出网页总结、竞品对比与学习资料整理等高频需求。下一步,我希望先提升这些任务的稳定性,再把反复验证的步骤沉淀为可调整的 Skill:保留任务目标、输入要求、材料范围、工具、步骤和输出格式,避免绑定某一次任务的具体页面。

Tabbit · 妙招入口 · 点击放大
NEXT EXPERIENCE

汽水音乐 · 首页内容与推荐策略

下一个项目 ↗