agent-replay

Articles related to "agent-replay"

2 articles in total

我意外地构建了一个前线部署工程师的野外工具包

本文作者 Ferhat Atagün 回顾了他在一年时间内构建的五个AI诊断工具,并意外发现这些工具的架构决策完全符合前线部署工程师(FDE)的工作约束。作者最初认为自己是出于偏好和惰性选择了浏览器优先、自带密钥(BYOK)、无后端、零安装和实时成本渲染的架构,但后来发现这些选择正好满足了在客户受监管环境中部署AI的需求:无需安装任何软件、数据不离开客户边界、最小化依赖面、安全团队无需威胁建模。文章详细分析了五个工具的功能分类,包括用于可观测性的 claudoscope(X射线分析实时调用中的token组成、缓存读写和成本)、agent-replay(将Agent轨迹重放为时间线)、context-lens(预检提示词在窗口中的位置和成本边界)、prompt-lab(并行对比两个提示词的输出、延迟和成本)以及tool-lab(沙箱化工具调用循环)。作者坦诚Guardrails(防护栏)工具的缺失,并指出模型输出的结构化失败是分布性问题而非单次测试问题,需要构建工具来运行提示词50次并展示失败分布。核心观点是:一个有明确约束的工具与玩具的区别在于能否清晰阐述设计约束,这对于希望进入AI领域的工程师尤为重要。

Read More

我意外地构建了一个前向部署工程师(forward-deployed engineer)的现场工具包(field kit)

本文由 Ferhat Atagun 撰写,分享了其意外构建一系列符合 FDE(前沿部署工程师)现场工具包约束的浏览器工具的经历。作者通过回顾自己开发的五个浏览器端工具(claudoscope、agent-replay、context-lens、prompt-lab、tool-lab),发现其架构决策(仅浏览器运行、BYOK自带密钥、无后端、零安装)无意中符合了在客户受监管环境中部署 AI 的核心约束:无须安装、数据不出边界、最小化依赖面、无服务器攻击面。文章将这五款工具映射到 FDE 工具分类框架(可观测性、评估、编排、护栏),发现前三类已覆盖但缺失关键护栏工具,并指出下一个应构建的工具是用于检测模型输出格式漂移的分布性验证工具。核心洞察是,有明确约束的工具与无约束的玩具之间的区别在于对真正运行约束的清晰定义,而非技术本身,这对前端工程师转型 AI 领域具有借鉴意义。

Read More