18 lines
7.4 KiB
TeX
18 lines
7.4 KiB
TeX
\chapter{引言}
|
||
|
||
% 近年来,生成式人工智能(Generative Artificial Intelligence, GenAI)和多模态大模型快速发展,智能服务正在由传统文本交互逐渐扩展到持续感知、在线理解和实时决策。基于视觉语言模型(Vision-Language Model, VLM)和视觉语言动作模型(Vision-Language-Action Model,VLA)的实时视觉模型业务,已经开始出现在具身智能、机器人控制、实时视频对话、远程巡检和边缘智能等场景中。
|
||
% % 一方面,生成式AI业务的激增正在成为网络流量增长的主要驱动力之一\cite{cisco_cisco_2024},已经有研究开始。另一方面,
|
||
% 在这类业务中,终端侧通常需要持续采集摄像头视频,并通过网络将视频流传输至边缘服务器或云端模型,由模型完成视觉理解、问答推理或动作决策后再将结果返回终端。由于终端侧算力和能耗受限,而VLM/VLA等模型通常具有较高计算开销,实时视觉模型推理业务往往难以完全依赖本地计算,而需要借助边缘或云端算力支撑\cite{ahmad_vision-language_2026,wang_runespoor_2021}。在这种系统形态下,WebRTC(Web Real-Time Communication)和Wi-Fi成为承载实时视频上传和模型交互的重要通信技术基础。因此针对实时视觉模型推理业务的无线视频传输优化,已经成为一个亟需解决的关键问题。
|
||
近年来,生成式人工智能(Generative Artificial Intelligence, GenAI)业务呈现爆发式增长。截止2026年3月,中国日均Token调用量已超过140万亿次,较2025年底增长约40\%;AI搜索流量预计将于2028年超越传统搜索,对无线网络格局产生深远影响\cite{IEEE_HUAWEI_bn_for_ai}。与传统多媒体业务相比,GenAI业务呈现出显著不同的流量特征——上行方向,受多模态大模型发展驱动,持续上传视频、图像等多模态数据,呈现高上行带宽、强突发性和多模态交织的特点;下行方向则主要表现为流式文本或语音回应的短包传输,呈现高频小包特征。上述特征已引起IEEE 802.11等无线标准化组织的高度关注\cite{huawei2025wireless,IEEE_HUAWEI_Post_bn,IEEE_HUAWEI_bn_for_ai}。与此同时,智能服务正从传统文本交互向持续感知、在线理解和实时决策演进,基于视觉语言模型(Vision-Language Model, VLM)和视觉语言动作模型(Vision-Language-Action Model, VLA)的实时视觉模型业务逐渐从云端下沉至边缘,支撑具身智能、机器人控制、实时视频对话和远程巡检等应用。作为边缘场景的核心无线接入技术,Wi-Fi网络的传输能力直接决定了上述业务的部署可行性与服务质量。为此,IEEE 802.11标准化组织已成立AI Offload研究小组,探索将计算密集型AI推理任务卸载到边缘Wi-Fi接入点及其他支持Wi-Fi的边缘计算设备\cite{IEEE_80211_AIO_SG_agenda}。由于终端侧算力和能耗受限,此类业务通常需要持续上传摄像头视频至边缘AP,基于推理结果做出决策\cite{ahmad_vision-language_2026,wang_runespoor_2021}。在这一过程中,视频传输质量直接决定模型"看到"了什么、何时看到,从而深刻影响推理准确率和响应及时性;而WebRTC作为承载实时音视频交互的关键协议,其与Wi-Fi之间的协同效率将直接影响传输效果。因此,研究面向视觉模型推理质量的WebRTC–Wi-Fi视频传输优化机制,具有紧迫的理论意义和实际价值。
|
||
|
||
然而,实时视觉模型推理对视频传输提出了不同于传统视频会议、云游戏和虚拟现实等业务的新要求。传统实时视频应用主要面向人类观看体验,通常关注清晰度、卡顿率、端到端时延和交互流畅性;而实时视觉模型业务的最终目标并不是让人“看得更清楚”,而是让模型在限定时间内获得对任务有用的视觉信息,从而提高任务准确率、响应及时性和推理稳定性。不同视觉任务对视频传输的敏感因素可能存在显著差异:例如,文字识别、细粒度目标识别等任务可能更依赖图像清晰度和空间细节,动态事件理解和机器人感知任务可能更依赖帧率、时序连续性和视频帧新鲜度。因此,传统网络服务质量(Quality of Service, QoS)或面向人类观看体验的体验质量(Quality of Experience, QoE)指标,未必能够准确反映实时视觉模型的服务质量。现有实时视觉大模型研究虽然已经开始关注连续视频输入、在线理解和低时延推理\cite{chen_videollm-online_2024,niu_ovo-bench_2025,zou_codecsight_2026},但对无线网络状态、WebRTC传输行为和视频质量变化如何影响模型推理效果,仍缺少系统分析。
|
||
|
||
与此同时,现有WebRTC优化研究和Wi-Fi实时业务优化研究也难以直接满足上述需求。一方面,现在还少有研究面向模型服务质量。另一方面,WebRTC和Wi-Fi协议分属不同网络层,两者存在天然的不透明性。在Wi-Fi网络中,信道竞争、无线重传、链路速率变化和队列积压会显著影响时延和丢包表现,但WebRTC仅依赖端到端反馈时,难以及时准确地区分真实网络拥塞和无线链路波动,也难以利用Wi-Fi内部状态优化拥塞控制和FEC(Forward Error Correction)策略。而WiFi同样无法感知WebRTC的帧类型和帧级截止时间,难以做优先级调度和过期包清理。现有研究大多分别从WebRTC侧或Wi-Fi侧进行优化,仅有少量工作尝试引入跨层信息。并且现有引入跨层信息的工作通常只引入了单方面的跨层感知,并以一个协议为主体进行优化,尚未形成 WebRTC、Wi-Fi 之间的双向协同机制\cite{yi_athena_2024, shen_law_2026}。也就是说,WebRTC通常不了解Wi-Fi内部的信道竞争和队列状态,Wi-Fi也不了解WebRTC数据包所属视频帧的重要性、截止时间和冗余属性,二者难以围绕视觉模型QoE进行联合优化。
|
||
|
||
针对上述问题,本文拟研究面向实时视觉模型推理质量的WebRTC–Wi-Fi跨层协同传输方法。
|
||
\begin{itemize}
|
||
\item 首先,本文拟基于ns-3和ns3-ai构建闭环联合仿真平台,将真实视频客户端、WebRTC传输机制、ns-3 Wi-Fi网络仿真和实际部署的VLM/VLA推理服务连接起来,实现视频上传、无线传输、模型推理和结果返回的完整业务闭环。
|
||
\item 其次,本文拟利用该平台系统分析Wi-Fi网络状态、WebRTC视频传输行为和视觉模型推理质量之间的关联关系,明确不同网络状态和视频传输指标对模型准确率、响应时延和信息新鲜度的影响。
|
||
\item 在上述分析的基础上,本文拟设计WebRTC–Wi-Fi双向跨层协同优化方法:一方面使WebRTC能够感知Wi-Fi的信道竞争、无线重传、链路速率和队列状态,并据此优化码率选择、发送节奏和FEC策略;另一方面使Wi-Fi能够感知WebRTC提供的视频帧类型、帧级截止时间、数据重要性和冗余属性,并据此进行优先级调度、关键帧保障和过期帧清理。
|
||
\end{itemize}
|
||
与传统更关注人类视觉体验的优化机制不同,本文提出的WebRTC–Wi-Fi跨层协同优化方法将以视觉模型推理质量为核心指标,并尝试建立两者之间的双向协同机制,旨在提升实时视觉模型推理的准确率和响应速度,从而更好地支撑边缘AI业务的发展。 |