
语言模型擅长符号,却看不见世界。多模态大模型要做的,是把像素、声音、时序与文字对齐到同一个表征空间,让 AI 具备"看图说话、听音辨位、观视频知因果"的能力。
主流路线是用一个视觉编码器把图像切成 patch 向量,再通过投影层"翻译"成语言模型能读懂的 token,与文本拼在一起做统一建模。关键挑战有三:视觉 token 数量爆炸带来的算力压力、细粒度空间定位("第三排左数第二个零件")的精度、以及长视频的时间因果推理。
多模态在质检、医疗影像初筛、自动驾驶感知、机器人抓取等场景价值巨大,但对"物理常识"仍有硬伤:它可能准确描述画面却误判因果。落地时要用规则、传感器与人工复核为高风险决策兜底。
让模型看懂世界,不只是识别得更准,而是把视觉、语言与行动闭环起来——这正是通往具身智能的必经之路。
