VAD中的 Query:主要是一种隐式的特征聚合工具。虽然 Map Query 和 Agent Query 也对应了具体的地图线和车辆,但它们最终只是为了填充 Ego Query 的信息量。
VADv2中的 Token:是一种显式的实体/动作表示。
Scene Tokens(Map Token, Agent Token等):显式表示场景中的具体实体。
Planning Tokens:显式表示动作空间中的离散动作。 这种 Token 化使得整个自动驾驶任务变成了类似语言模型中的“给定上下文,预测下一个词”的任务,极大地提升了模型的可扩展性和与规则结合的灵活性。