ACL Findings|让大模型直接生成任务界面
这篇论文提出 Generative Interfaces:大模型不再只返回一段文字,而是根据当前问题生成一套可操作的网页界面。
动机:聊天界面通常采用“用户提问—模型输出长文本”的线性结构。面对多步骤、信息密集或需要反复探索的任务,用户还要自己从文本中提取步骤、记住状态并组织操作。
系统工作流程
1. Requirement specification:先把用户请求转换成需求说明,明确任务目标、功能、UI 组件、交互方式和解决策略。
2. Structured representation:用两层结构描述界面。高层 interaction flow 是有向图,节点表示页面或子目标,边表示点击等事件触发的跳转;低层 finite state machine 为每个组件定义状态集合 S、用户事件 E、状态转移函数 δ 和初始状态 s₀。
3. UI generation:把原始请求、需求说明、结构表示、可复用组件库,以及网页检索得到的示例和数据一起交给 Claude 3.7,生成可执行的 HTML、CSS 和 JavaScript。
4. Adaptive reward:模型针对当前任务生成评分维度、权重和检查规则。例如量子物理学习界面会分别评价视觉结构、概念解释和清晰度,最后得到 0–100 分。
5. Iterative refinement:每轮生成多个候选界面,保留得分最高者,并把评分反馈用于下一轮修改;总分达到 90,或完成 5 轮后停止。
与 Claude 3.7 的纯聊天输出相比,GenUI 的胜率为 84%,平局 4%;与 GPT-4o 聊天输出相比胜率69%;与“直接提示 Claude 生成 UI”的基线相比为 75%。偏好在数据分析与可视化领域达到 93.8%,但在 AI/ML 中只有 50%。
作者承认三项限制:当前只生成没有后端逻辑的 HTML/JavaScript 前端;多轮修改可能耗时数分钟;系统对所有请求都生成 UI,即使简单问题使用文本更合适。生成界面也可能带来无障碍问题、错误信息、诱导性呈现,以及“界面越精致,用户越容易过度信任”的风险。
howto入门codex 科研 人机交互 PhD 大模型 生成式界面 LLM howto用AI抢救一切 学术





