跳转到内容

AI、AGENT 与上下文 · DEFINED TERM

多模态

同一模型或流程能够处理文字、图片、音频等多种输入。

你可能会这样说“把截图和文字需求一起看,再指出界面问题”

VISUAL EXAMPLE

先看懂它怎么工作

界面状态示例

等待操作

MECHANISM

运行机制

  1. 不同输入编码
  2. 对齐到共同表示
  3. 联合理解
  4. 生成结果

USE WHEN

适合这样用

分析截图、图表、语音和混合资料

NOT FOR

不要这样理解

不要假定模型能读取图片里所有小字或隐含尺寸

TELL YOUR AGENT

可直接发给 Agent

请按“多模态”的概念处理这个需求:把截图和文字需求一起看,再指出界面问题。先说明实现边界,再给出可检查的结果。

ACCEPTANCE

怎么确认它真的做好了

关键视觉信息有人工或工具复核,低清输入会主动提示

OFFICIAL SOURCES

官方来源