Files
mcx_kaiti/text/01_introduction.tex
T
2026-06-23 16:35:01 +08:00

18 lines
7.4 KiB
TeX
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
\chapter{引言}
% 近年来,生成式人工智能(Generative Artificial Intelligence, GenAI)和多模态大模型快速发展,智能服务正在由传统文本交互逐渐扩展到持续感知、在线理解和实时决策。基于视觉语言模型(Vision-Language Model, VLM)和视觉语言动作模型(Vision-Language-Action Model,VLA)的实时视觉模型业务,已经开始出现在具身智能、机器人控制、实时视频对话、远程巡检和边缘智能等场景中。
% % 一方面,生成式AI业务的激增正在成为网络流量增长的主要驱动力之一\cite{cisco_cisco_2024},已经有研究开始。另一方面,
% 在这类业务中,终端侧通常需要持续采集摄像头视频,并通过网络将视频流传输至边缘服务器或云端模型,由模型完成视觉理解、问答推理或动作决策后再将结果返回终端。由于终端侧算力和能耗受限,而VLM/VLA等模型通常具有较高计算开销,实时视觉模型推理业务往往难以完全依赖本地计算,而需要借助边缘或云端算力支撑\cite{ahmad_vision-language_2026,wang_runespoor_2021}。在这种系统形态下,WebRTCWeb Real-Time Communication)和WiFi成为承载实时视频上传和模型交互的重要通信技术基础。因此针对实时视觉模型推理业务的无线视频传输优化,已经成为一个亟需解决的关键问题。
近年来,生成式人工智能(Generative Artificial Intelligence, GenAI)业务呈现爆发式增长。截止2026年3月,中国日均Token调用量已超过140万亿次,较2025年底增长约40\%;AI搜索流量预计将于2028年超越传统搜索,对无线网络格局产生深远影响\cite{IEEE_HUAWEI_bn_for_ai}。与传统多媒体业务相比,GenAI业务呈现出显著不同的流量特征——上行方向,受多模态大模型发展驱动,持续上传视频、图像等多模态数据,呈现高上行带宽、强突发性和多模态交织的特点;下行方向则主要表现为流式文本或语音回应的短包传输,呈现高频小包特征。上述特征已引起IEEE 802.11等无线标准化组织的高度关注\cite{huawei2025wireless,IEEE_HUAWEI_Post_bn,IEEE_HUAWEI_bn_for_ai}。与此同时,智能服务正从传统文本交互向持续感知、在线理解和实时决策演进,基于视觉语言模型(Vision-Language Model, VLM)和视觉语言动作模型(Vision-Language-Action Model, VLA)的实时视觉模型业务逐渐从云端下沉至边缘,支撑具身智能、机器人控制、实时视频对话和远程巡检等应用。作为边缘场景的核心无线接入技术,WiFi网络的传输能力直接决定了上述业务的部署可行性与服务质量。为此,IEEE 802.11标准化组织已成立AI Offload研究小组,探索将计算密集型AI推理任务卸载到边缘WiFi接入点及其他支持WiFi的边缘计算设备\cite{IEEE_80211_AIO_SG_agenda}。由于终端侧算力和能耗受限,此类业务通常需要持续上传摄像头视频至边缘AP,基于推理结果做出决策\cite{ahmad_vision-language_2026,wang_runespoor_2021}。在这一过程中,视频传输质量直接决定模型"看到"了什么、何时看到,从而深刻影响推理准确率和响应及时性;而WebRTC作为承载实时音视频交互的关键协议,其与WiFi之间的协同效率将直接影响传输效果。因此,研究面向视觉模型推理质量的WebRTC–WiFi视频传输优化机制,具有紧迫的理论意义和实际价值。
然而,实时视觉模型推理对视频传输提出了不同于传统视频会议、云游戏和虚拟现实等业务的新要求。传统实时视频应用主要面向人类观看体验,通常关注清晰度、卡顿率、端到端时延和交互流畅性;而实时视觉模型业务的最终目标并不是让人“看得更清楚”,而是让模型在限定时间内获得对任务有用的视觉信息,从而提高任务准确率、响应及时性和推理稳定性。不同视觉任务对视频传输的敏感因素可能存在显著差异:例如,文字识别、细粒度目标识别等任务可能更依赖图像清晰度和空间细节,动态事件理解和机器人感知任务可能更依赖帧率、时序连续性和视频帧新鲜度。因此,传统网络服务质量(Quality of Service, QoS)或面向人类观看体验的体验质量(Quality of Experience, QoE)指标,未必能够准确反映实时视觉模型的服务质量。现有实时视觉大模型研究虽然已经开始关注连续视频输入、在线理解和低时延推理\cite{chen_videollm-online_2024,niu_ovo-bench_2025,zou_codecsight_2026},但对无线网络状态、WebRTC传输行为和视频质量变化如何影响模型推理效果,仍缺少系统分析。
与此同时,现有WebRTC优化研究和WiFi实时业务优化研究也难以直接满足上述需求。一方面,现在还少有研究面向模型服务质量。另一方面,WebRTC和WiFi协议分属不同网络层,两者存在天然的不透明性。在WiFi网络中,信道竞争、无线重传、链路速率变化和队列积压会显著影响时延和丢包表现,但WebRTC仅依赖端到端反馈时,难以及时准确地区分真实网络拥塞和无线链路波动,也难以利用WiFi内部状态优化拥塞控制和FECForward Error Correction)策略。而WiFi同样无法感知WebRTC的帧类型和帧级截止时间,难以做优先级调度和过期包清理。现有研究大多分别从WebRTC侧或WiFi侧进行优化,仅有少量工作尝试引入跨层信息。并且现有引入跨层信息的工作通常只引入了单方面的跨层感知,并以一个协议为主体进行优化,尚未形成 WebRTC、WiFi 之间的双向协同机制\cite{yi_athena_2024, shen_law_2026}。也就是说,WebRTC通常不了解WiFi内部的信道竞争和队列状态,WiFi也不了解WebRTC数据包所属视频帧的重要性、截止时间和冗余属性,二者难以围绕视觉模型QoE进行联合优化。
针对上述问题,本文拟研究面向实时视觉模型推理质量的WebRTC–WiFi跨层协同传输方法。
\begin{itemize}
\item 首先,本文拟基于ns-3和ns3-ai构建闭环联合仿真平台,将真实视频客户端、WebRTC传输机制、ns-3 WiFi网络仿真和实际部署的VLM/VLA推理服务连接起来,实现视频上传、无线传输、模型推理和结果返回的完整业务闭环。
\item 其次,本文拟利用该平台系统分析WiFi网络状态、WebRTC视频传输行为和视觉模型推理质量之间的关联关系,明确不同网络状态和视频传输指标对模型准确率、响应时延和信息新鲜度的影响。
\item 在上述分析的基础上,本文拟设计WebRTC–WiFi双向跨层协同优化方法:一方面使WebRTC能够感知WiFi的信道竞争、无线重传、链路速率和队列状态,并据此优化码率选择、发送节奏和FEC策略;另一方面使WiFi能够感知WebRTC提供的视频帧类型、帧级截止时间、数据重要性和冗余属性,并据此进行优先级调度、关键帧保障和过期帧清理。
\end{itemize}
与传统更关注人类视觉体验的优化机制不同,本文提出的WebRTC–WiFi跨层协同优化方法将以视觉模型推理质量为核心指标,并尝试建立两者之间的双向协同机制,旨在提升实时视觉模型推理的准确率和响应速度,从而更好地支撑边缘AI业务的发展。