FlowEval: Reference-Based Evaluation of Generated User Interfaces
虽然大型语言模型 (LLM) 和编码代理通常应用于用户界面 (UI) 开发,但开发人员发现很难可靠地评估他们在视觉和交互设计方面的熟练程度。现有的评估要么依靠人类专家,他们可以通过测试关键流程来准确评估可用性,但速度慢且成本高;要么依靠自动化法官,虽然可扩展,但准确性较差且不透明。我们提出了 FlowEval,一个基于参考的框架,通过比较真实网站的导航轨迹与轨迹来衡量生成的 UI 是否支持真实的交互流......