模型切换与上线
将 Stage 1 的选表、意图检测等模型由 Haiku 切换至 DeepSeek Flash,完成 A/B Test、灰度验证与上线落地。
两段实习覆盖内部平台与 AI 应用开发。我参与 Text2SQL 从 Agent Demo 到内部 MCP Tool 的落地,也承担 Agent 测评、Code Review、系统需求与看板搭建等工作。
围绕速度、准确性与安全性,推动内部 Text2SQL 能力从前期 Agent Demo 演进为实际使用的 MCP Tool。
将 Stage 1 的选表、意图检测等模型由 Haiku 切换至 DeepSeek Flash,完成 A/B Test、灰度验证与上线落地。
优化提示词设计与缓存命中效率,并新增渐进式披露接口,按知识域向 Agent 提供改写参考。
完善提示词内的权限约束与接口返回内容的保密控制,让工具在企业数据边界内稳定工作。
更快 · 更准 · 更安全
围绕日常即时检查与完整回归测试,搭建 Agent / MCP Tool 自动化测评框架。
Skill 用于日常提问后的即时检查;Claude Agent SDK 用于完整、无人工干预的自动化测评。
通过人工与自动方式汇总线上问题,把真实失败案例持续沉淀为测试样例。
在版本更新前运行回归测试,观察工具调用过程与最终回答,减少能力迭代引入的退化。
把需求级代码审查沉淀成可复用的 Skill,覆盖 trunk 开发阶段与 release 合并阶段的不同风险。
以 ref# 聚合同一需求的前后端提交,按技术栈分流,并让审查 Agent 自取 diff 与最终文件,控制主上下文规模。
预处理后按需求并行审查,统一输出严重、警告与建议三级结论;只报告能说明触发条件和后果的问题。
补充合并完整性、同文件碰撞、缺文件和待合并版本干扰检查,覆盖“已合并但合得不完整”的风险。
参与部门核心业务系统的持续开发,支持网易外包、外派及美术协作环节的整体管理。
面向实际业务流程完成新需求开发,把业务规则落实为可维护的系统能力。
持续维护与优化既有接口,配合上下游使用场景改进平台体验。
除核心项目外,也承担数据观察、分析验证与周边系统需求。
组织关键指标与展示方式,帮助团队观察系统运行状态。
支持业务数据整理与导出需求,为后续分析提供可用数据。
围绕业务分析场景调研 BI 能力与可行的落地方式。
参与质量数据可视化相关系统的需求开发。