Files
mcx_kaiti/text/03_method.tex
T

226 lines
30 KiB
TeX
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
\chapter{研究内容与方法}
本文围绕 Wi-Fi 网络中实时视觉模型推理业务的传输优化问题展开研究。具体而言,本文研究内容包括四个层次:首先构建能够运行真实视觉模型业务的系统级联合仿真平台,为后续实验提供可控、可重复的环境;其次利用该平台分析Wi-Fi网络状态、WebRTC 传输行为和视觉模型任务性能之间的跨层关联;然后在关联分析的基础上设计面向视觉任务需求的 WebRTC–Wi-Fi 联合优化方法;最后通过在不同场景下的实验验证所提出方法的有效性。接下来将详细介绍每个层次的研究内容和方法。
\section{系统模型}
\begin{figure}[!h]
\centering
\includegraphics[width=0.6\linewidth]{figure/毕业论文-系统场景.pdf}
\caption{面向实时视觉模型推理的WebRTC–Wi-Fi联合优化系统模型}
\label{fig:system_model}
\end{figure}
\section{面向实时视觉模型业务的闭环联合仿真平台}
% 本文首先研究如何构建一个能够支撑真实实时视觉模型业务的无线通信联合仿真平台。
\subsection{研究内容}
实时视觉模型业务具有视频持续输入、模型在线推理和结果实时返回等特点,如果仅使用预先生成的流量模型或离线网络轨迹,难以准确反映网络变化对模型任务结果的影响,并且考虑到可复现性和可分析性,本研究最终决定使用半实物仿真来支撑后续的分析和研究。现有仿真平台难以同时满足真实业务闭环、Wi-Fi 细粒度仿真和可复现实验需求,因此本研究决定首先建立一个能够同时包含真实业务逻辑、WebRTC传输过程和Wi-Fi网络仿真的闭环仿真实验平台。
该平台以ns-3作为Wi-Fi网络仿真基础,用于模拟客户端与服务端之间的无线通信过程。ns-3能够较细粒度地描述Wi-Fi网络中的信道竞争、调制编码方式、无线重传、队列变化和多终端接入等现象,适合用于研究无线网络状态对实时业务的影响。同时,平台使用ns3-ai模块提供的共享内存通信机制,将ns-3仿真进程与外部真实应用进程连接起来,使仿真网络不再只是处理预设模型产生的流量,而是可以承载真实应用产生的视频流和业务请求。本研究力求将该框架构建成一个通用的联合仿真平台,因此并不假定GenAI客户端和GenAI服务端的具体实现,而是提供标准化的接口。这意味着GenAI客户端可以是任何能够发送请求的仿真器(例如Maniskill等机器人仿真器)或实物,GenAI服务端可以是任何能够接收请求并返回结果的模型——这意味着本研究既可以部署LLM/VLM等真实模型,也可以使用现成的流量模型,甚至可以支持LLM ServingSim等专门的模型推理仿真器。通过这种设计,平台能够适应不同的研究需求和实验场景,具有较强的灵活性和扩展性。
\subsection{技术路线}
\begin{figure}[!h]
\centering
\includegraphics[width=0.6\linewidth]{figure/ns3agent-overview-zh.pdf}
\caption{面向GenAI业务的联合仿真平台}
\label{fig:ns3agent-overview}
\end{figure}
如图~\ref{fig:ns3agent-overview}所示,在平台运行过程中,客户端连接视频采集与请求程序,将实时视频流以及任务请求送入 ns-3仿真的网络中。ns-3将视频流通过WebRTC协议发送到Wi-Fi网络中,并模拟视频分组在无线链路中的传输过程,包括排队、竞争、重传、丢包和时延变化。服务端连接已经部署好的视觉语言模型或视觉语言动作模型服务,在接收到视频流和请求后完成推理,并将模型生成的文本响应、决策结果或控制指令通过同一仿真网络返回客户端。由此,平台形成从客户端输入、无线网络传输、模型推理到结果返回的完整闭环。
该平台的关键难点在于联合仿真的时间同步和时序因果一致性。ns-3采用离散事件仿真机制,内部按照仿真时间推进,而外部视频客户端和模型服务器运行在真实时间中。如果两者之间缺少严格的同步机制,就会出现事件的时序因果错误。以GenAI客户端与ns-3网络之间的二分交互为例:假设初始时间点为$t_0$,客户端计划在未来的时间点$t_1$向ns-3发送请求。为避免因果性违规,客户端必须在$t_1$准确暂停,并确保ns-3的仿真时间尚未推进到$t_1$之后,然后在客户端和ns-3的时间都到达$t_1$时,客户端才能将请求发送到ns-3中。
作为联合仿真的一个经典问题,本研究参考High Level Architecture(HLA)同步机制的实现,设计了一种基于前瞻量的保守时间同步机制。此机制要求GenAI客户端/服务端和ns-3仿真器在每次同步事件中交换当前时间和前瞻承诺(Lookahead)参数,以独立计算下一个安全同步点,从而确保双方都能安全地推进时间而不违反时序因果性。所谓前瞻量可以理解为一个严格的时间承诺,即在当前时间点$T_k$加上前瞻值$TL_{k}$之前,相关仿真器绝对不会生成任何面向另一个仿真器的新事件或数据。
\begin{figure}
\centering
\includegraphics[width=0.6\linewidth]{figure/time_syn.pdf}
\caption{联合仿真时间同步示意图}
\label{fig:time_syn}
\end{figure}
如图~\ref{fig:time_syn}所示,在每次同步事件中,外部仿真器(如GenAI客户端)与ns-3网络环境之间会进行一次双向数据交换。客户端将其当前仿真时间记为$T_k$,并将其前瞻承诺记为$TL_{k}^{(c)}$发送给ns-3。前瞻值$TL_{k}^{(c)}$作为一项严格保证,确保客户端在$T_k + TL_{k}^{(c)}$之前绝对不会生成任何面向ns-3网络的新事件或数据。与此同时,ns-3仿真器也将其当前时间$T_k$及其前瞻值$TL_{k}^{(n)}$发送给客户端。基于这些交换的参数,系统使用以下公式独立计算所有交互域之间的下一个安全同步点$T_{k+1}$
\begin{equation}
T_{k+1}=T_k+\min\left(TL_{k}^{(c)}, TL_{k}^{(n)}\right),
\end{equation}
从而确保两个仿真器可以安全地将各自本地时钟推进至$T_{k+1}$,而不会违反时序因果性。
该研究产出一个面向通用智能体AI工作流的跨平台联合仿真框架,支持真实视觉模型业务的闭环仿真。该平台不仅能够用于分析Wi-Fi网络状态、WebRTC传输行为和视觉模型任务性能之间的关系,还能够为后续设计多种GenAI业务场景提供支持。因此后续本文可以利用该平台模拟出具身智能、AI视频问答等多种GenAI业务场景,并在此基础上分析不同网络状态下视觉模型任务的性能表现,为后续的优化方法设计提供数据支持和理论依据。
\section{Wi-Fi、WebRTC和视觉模型任务性能的跨层关联分析}
在完成联合仿真平台的基础上,本文进一步研究Wi-Fi网络状态、WebRTC视频传输行为和视觉模型任务性能之间的关联关系。该部分的核心目标不是立即提出优化算法,而是先回答一个基础问题:动态Wi-Fi网络中的链路变化究竟会通过什么机制影响WebRTC视频传输,并进一步影响实时视觉模型的QoE指标。在本文中,模型QoE指标用于描述实时视觉模型业务的最终服务质量,为了定量描述,本文将模型 QoE 定义为由准确性、TTFT(首 token 响应时间)、ITL(Token 间隔)和输入帧新鲜度(以视频帧的传输时延衡量)共同构成的综合指标。
\subsection{研究内容}
本文拟首先分析 Wi-Fi 状态对 WebRTC 传输行为的影响。在 Wi-Fi 网络中,信道竞争、链路速率变化、无线重传和队列积压会改变端到端时延、丢包率、抖动和可用带宽,从而影响 WebRTC 的带宽估计、码率调整、FEC 冗余配置和视频帧传输时延。本文将通过实验分析不同 Wi-Fi 底层状态变化是否会导致 WebRTC 拥塞控制产生滞后、误判或过度保守等现象。
其次,本文拟分析 WebRTC 视频传输行为对视觉模型任务性能的影响。对于实时视觉模型业务,视频质量下降并不一定直接等价于模型性能下降,不同任务对视频分辨率、帧率、关键帧丢失、帧完成时延和输入帧新鲜度的敏感程度可能不同。例如,文字识别和细粒度目标识别任务可能更依赖空间细节,异常事件识别任务可能更依赖时间连续性,实时视频问答和机器人感知任务则可能更加关注输入帧新鲜度和模型响应及时性。因此,本文将比较不同视频传输质量和不同任务类型下模型准确率、任务成功率、TTFT 和 ITL 分布的变化规律。
最后,本文拟分析传统网络 QoS、视频 QoE 指标与模型 QoE 之间的对应关系。本文将重点判断吞吐量、RTT、丢包率、抖动、视频码率、帧率和帧完成时延等传统指标,是否能够稳定解释模型任务准确率和响应时延变化。如果发现传统指标与模型 QoE 之间存在不一致现象,则进一步说明面向视觉模型业务进行专门跨层优化的必要性。
\subsection{技术路线}
本文将基于联合仿真平台开展多因素控制实验。实验中将 Wi-Fi 网络条件、WebRTC 传输配置和视觉任务类型作为主要实验变量,并同步采集 Wi-Fi 层、WebRTC 层和模型任务层的观测指标。具体实验变量与观测指标如表~\ref{tab:3} 所示。
\begin{table}[htbp]
\centering
\small
\caption{跨层关联分析的实验变量与观测指标}
\label{tab:3}
\begin{tabular}{p{0.18\textwidth} p{0.36\textwidth} p{0.36\textwidth}}
\hline
层次 & 实验变量或观测指标& 分析目的 \\
\hline
Wi-Fi 层 & 信道质量、背景流量强度、竞争终端数量、信道忙碌比例、MCS、无线重传率、队列长度、竞争时延等 & 分析无线链路状态和接入竞争对端到端传输行为的影响 \\
\hline
WebRTC 层 & 发送码率、目标码率、带宽估计值、RTT、丢包率、抖动、FEC 冗余率、视频帧大小、关键帧比例、帧完成传输时延、发送队列状态等 & 分析 WebRTC 自适应传输行为及其对视频帧质量、时延和新鲜度的影响 \\
\hline
模型任务层 & 任务准确率、任务成功率、TTFT、ITL 均值、ITL 高分位数、模型响应完成时延、输入帧新鲜度、过期帧比例等 & 分析网络和视频传输变化对最终模型服务质量的影响 \\
\hline
\end{tabular}
\end{table}
在数据分析方法上,本文拟采用统计分析和数据驱动建模相结合的方式。首先,通过相关性分析、分组对比和敏感性分析,识别哪些 Wi-Fi 状态和 WebRTC 传输指标与模型准确率、TTFT 和 ITL 变化关系最为密切。其次,通过多变量回归、决策树或轻量级机器学习模型,建立从跨层状态到模型 QoE 的预测关系,用于判断不同网络状态和传输行为对模型任务效果的影响程度。最后,针对不同视觉任务分别分析关键影响因素,形成任务类型与传输敏感因素之间的对应关系。
该部分研究预期形成三类结果。第一,获得 Wi-Fi 底层状态对 WebRTC 拥塞控制、码率调整和视频帧传输时延的影响规律;第二,获得视频传输质量、帧新鲜度和模型任务准确率、TTFT、ITL 之间的关联关系;第三,筛选出对模型 QoE 影响显著的跨层状态和控制变量,为后续强化学习优化方法中的状态空间、动作空间和奖励函数设计提供依据。通过该部分研究,本文将从实验数据层面说明为什么需要进行 WebRTC--Wi-Fi 双向跨层协同优化,以及联合优化应重点关注哪些网络状态、视频传输参数和模型服务质量指标。
% 本文将利用联合仿真平台搭建视频传输与边缘视觉推理实验场景,在不同Wi-Fi信道质量、背景流量强度、竞争终端数量和视频配置下运行实验。实验中将同时采集Wi-Fi层、WebRTC层和模型任务层的信息。Wi-Fi层主要反映无线链路和接入竞争状态,包括信道忙碌程度、调制编码方式、无线重传、信号质量、发送队列和竞争时延等。WebRTC层主要反映端到端传输行为,包括带宽估计、往返时延、丢包率、抖动、发送速率、视频帧大小、视频帧传输时延和发送队列状态等。模型任务层则用于反映最终业务效果,包括输入视频分辨率、帧率、视频帧新鲜度、模型推理时延、模型响应时延、任务准确率和任务成功率等。
% 通过这些跨层数据,本文将分析Wi-Fi状态对WebRTC传输行为的影响。例如,当无线竞争加剧时,WebRTC观测到的RTT、丢包、抖动和带宽估计会如何变化;当信道质量下降或背景流量增加时,WebRTC会如何调整视频码率、帧率和分辨率;当发送队列发生积压时,视频帧是否会出现明显的长尾时延或过期现象。这一部分分析有助于判断WebRTC仅依靠端到端反馈是否能够及时、准确地反映Wi-Fi内部状态。
% 进一步地,本文将分析WebRTC视频传输变化对视觉模型任务性能的影响。对于实时视觉模型而言,视频质量下降并不一定等同于任务性能下降,不同任务对视频输入的敏感性可能不同。例如,细粒度识别或文字理解任务可能更依赖图像分辨率和空间细节,动态事件理解任务可能更依赖帧率和时间连续性,而交互式视觉问答或机器人感知任务则可能更加关注视频帧的新鲜度和响应及时性。因此,本文将比较不同视频配置、不同网络损伤和不同任务类型下模型性能的变化,分析哪些网络和视频指标更能反映模型任务质量。
% 该部分研究的产出是Wi-Fi、WebRTC和视觉模型任务性能之间的跨层影响规律。它将回答为什么需要进行跨层联合优化,以及联合优化应重点关注哪些状态和参数。换言之,该部分为后续方法设计提供数据依据和问题边界。
\section{面向视觉模型服务质量的WebRTC–Wi-Fi联合优化方法}
在完成跨层关联分析之后,本文将进一步研究面向视觉模型服务质量的 WebRTC–Wi-Fi 双向跨层协同优化方法。与传统实时视频传输优化主要关注网络吞吐量、端到端时延、丢包率或人类观看体验不同,本文拟将视觉模型任务的QoE作为最终优化目标。在此基础上,本文拟从研究内容和技术路线两个方面开展工作。
\subsection{研究内容}
本文拟建立 WebRTC 与 Wi-Fi 之间的双向跨层信息交互机制。
\textbf{1Wi-Fi状态辅助的WebRTC拥塞控制与FEC策略: }使 WebRTC 能够感知 Wi-Fi 层的信道竞争、无线重传、链路速率变化和队列积压等底层状态,从而辅助其进行码率调整、发送节奏控制和 FEC 冗余配置。相比仅依赖端到端 RTT、丢包率和带宽估计的传统 WebRTC 控制方式,引入 Wi-Fi 显式状态有助于减少无线环境下拥塞判断的滞后和误判。
% 现有WebRTC拥塞控制主要依赖往返时延、丢包率、分组到达时间和带宽估计等端到端反馈判断网络状态。在Wi-Fi网络中,信道竞争、无线重传、链路速率变化和队列积压都会影响WebRTC观测到的时延和丢包,但WebRTC难以判断这些变化究竟来自真实网络拥塞、无线竞争加剧还是短时链路波动。因此,本文拟建立Wi-Fi状态到WebRTC的上行反馈机制,使WebRTC能够直接获取信道忙碌程度、调制编码方式、无线重传次数、链路速率、发送队列长度等Wi-Fi的MAC层和物理层状态。
% 基于这些显式Wi-Fi状态,WebRTC可以更加准确地判断当前无线链路的可用能力,并据此调整拥塞控制策略。当Wi-Fi状态显示信道竞争加剧或链路速率下降时,WebRTC可以提前降低发送码率、调整视频帧率或改变发送节奏,避免持续向无线队列注入超过链路承载能力的数据;当无线重传和丢包风险上升时,WebRTC可以结合视频帧重要性和模型服务需求动态调整FEC冗余率,而不是对所有数据采用相同的冗余保护强度。通过这种方式,WebRTC的传输控制不再只依赖端到端试探,而是能够结合Wi-Fi内部状态进行更加及时和有针对性的自适应调整。
\textbf{2WebRTC帧级信息驱动的Wi-Fi队列管理: }使 Wi-Fi 层能够感知 WebRTC 提供的视频帧级信息,包括帧类型、帧级截止时间、数据重要性、FEC 冗余属性和过期状态等。基于这些信息,Wi-Fi 层可以在队列管理和分组调度过程中对不同数据进行差异化处理。例如,对关键帧和高重要性数据包给予更高传输优先级,对已经超过任务截止时间的过期帧进行及时清理,对 FEC 冗余数据根据当前链路状态和主数据包传输情况动态调整优先级。通过这种方式,Wi-Fi 层不再无差别传输所有视频数据,而是能够围绕视觉模型任务需求进行无线资源分配。
% 因此,本文拟将WebRTC中的视频帧类型、帧级截止时间、数据包所属帧的重要性、冗余数据标识和过期状态等信息传递给Wi-Fi层,使Wi-Fi能够根据视频数据的实时价值进行差异化处理。在无线队列资源有限或信道竞争严重时,Wi-Fi可以优先保障关键帧和高重要性数据包;对于已经超过截止时间的过期帧,可以将其对应的数据包从Wi-Fi队列中清除,以减少无效传输和队列阻塞;对于FEC冗余数据,可以根据当前链路状态和主数据包传输情况动态调整其优先级。这样,Wi-Fi层不再只是被动传输WebRTC注入的所有数据,而是能够根据WebRTC提供的帧级语义、时限和冗余信息进行更加有效的无线资源分配。
\textbf{3)模型QoE驱动的跨层联合决策: }在双向跨层信息交互的基础上,本文拟将 Wi-Fi 状态感知、WebRTC 帧级信息下传和模型服务质量反馈结合起来,形成面向实时视觉模型推理业务的跨层协同优化机制,使系统能够在视频质量、传输时延、帧新鲜度和无线资源利用之间进行联合权衡,从而提升模型任务准确率并降低模型任务响应时延。
% 在双向跨层信息交互的基础上,本文将视觉模型的QoE作为联合优化目标。这里的QoE主要包括模型任务准确率、响应时延、输入信息新鲜度、任务成功率和推理稳定性等指标。本文将模型QoE作为上层反馈信号,用于指导WebRTC在码率、FEC冗余率等方面进行调整。通过这种方式,系统能够使跨层传输策略更接近实时视觉模型服务的最终需求。具体而言,如果任务本身对图像清晰度并没有很高的要求,那么系统就不必追求高码率视频,而分配更多资源满足模型对实时性的需求,反之亦然。
% 具体而言,当模型准确率对空间细节较为敏感时,系统可以在网络允许的范围内优先保障较高分辨率或关键帧质量;当模型任务更加依赖实时性时,系统可以优先降低排队时延和过期帧比例,而不是盲目提高视频码率;当网络状态恶化时,系统可以根据模型QoE下降程度判断码率、冗余率和队列策略的调整幅度。由此,WebRTC和Wi-Fi的联合优化不再仅以吞吐量、丢包率或传统视频QoE为目标,而是直接围绕实时视觉模型的最终服务效果进行决策。
\subsection{技术路线}
本文拟将 WebRTC–Wi-Fi 联合优化问题建模为一个面向模型 QoE 的序贯决策问题。系统以固定控制周期运行,在每个控制周期内采集 Wi-Fi 层、WebRTC 层和模型任务层的跨层状态,并根据当前状态选择下一阶段的传输控制和无线调度动作。该问题可表示为马尔可夫决策过程,其中状态空间、动作空间和奖励函数分别设计如下。
首先,状态空间 $s_t$ 由 Wi-Fi 层状态、WebRTC 层状态和模型任务层状态共同组成:
\begin{equation}
s_t = \left[s_t^{wifi}, s_t^{rtc}, s_t^{model}\right]
\end{equation}
其中,Wi-Fi 层状态 $s_t^{wifi}$ 用于描述无线链路和接入竞争情况,主要包括信道忙碌比例、物理层速率或 MCS、无线重传率、发送队列长度、队列等待时延、竞争时延和背景流量强度等。WebRTC 层状态 $s_t^{rtc}$ 用于描述端到端视频传输行为,主要包括当前发送码率、目标码率、带宽估计值、RTT、丢包率、抖动、FEC 冗余率、视频帧大小、关键帧比例、视频帧完成传输时延和发送队列状态等。模型任务层状态 $s_t^{model}$ 用于描述视觉模型业务的服务质量,主要包括近期模型任务准确率、首 token 响应时间(Time to First Token, TTFT)、输出 token 间隔(Inter-Token Latency, ITL)的均值和高分位数等。
其次,动作空间 $a_t$ 由 WebRTC 侧控制动作和 Wi-Fi 侧调度动作组成:
\begin{equation}
a_t = \left[a_t^{rtc}, a_t^{wifi}\right]
\end{equation}
其中,WebRTC 侧动作 $a_t^{rtc}$ 主要包括目标码率调整、发送节奏调整、FEC 冗余率调整、视频帧率调整和分辨率等级调整等。Wi-Fi 侧动作 $a_t^{wifi}$ 主要包括关键帧优先级调整、普通帧优先级调整、FEC 冗余包优先级调整、过期帧清理阈值调整以及不同队列的调度权重调整等。考虑到连续动作空间会增加训练难度,本文初步拟采用离散化动作集合,例如对码率、FEC 冗余率、帧率和队列优先级分别设置“提高、保持、降低”三类动作,并根据后续实验结果进一步扩展为更细粒度的连续控制。
最后,奖励函数以模型 QoE 为核心进行设计。本文重点关注模型任务准确率和模型任务响应时延,其中响应时延包括 TTFT 和 ITL 的分布特征。对于第 $t$ 个控制周期,奖励函数可设计为:
\begin{equation}
r_t =
\alpha \widetilde{A}t
-\beta_1 \widetilde{L}{t}^{TTFT}
-\beta_2 \widetilde{L}{t}^{ITL}
-\beta_3 \widetilde{F}{t}^{stale}
-\beta_4 \widetilde{C}_{t}^{overhead}
\end{equation}
其中,$\widetilde{A}t$ 表示归一化后的模型任务准确率或任务成功率,$\widetilde{L}{t}^{TTFT}$ 表示归一化后的 TTFT 时延惩罚,$\widetilde{L}{t}^{ITL}$ 表示归一化后的 ITL 时延惩罚,$\widetilde{F}{t}^{stale}$ 表示输入视频帧过期或新鲜度下降带来的惩罚,$\widetilde{C}_{t}^{overhead}$ 表示过高码率、过高 FEC 冗余或过度占用无线资源带来的系统开销。$\alpha,\beta_1,\beta_2,\beta_3,\beta_4$ 为权重参数,可根据不同任务类型进行设置。
由于 ITL 的尾部时延会直接影响模型输出的连续性和交互稳定性,本文不仅考虑 ITL 的平均值,也将考虑其高分位数,例如 90 分位数或 95 分位数。因此,$\widetilde{L}_{t}^{ITL}$ 可以设计为 ITL 的均值和高分位数的加权组合,以同时反映整体时延水平和长尾时延风险。
基于上述建模,本文拟采用强化学习方法学习跨层控制策略。强化学习智能体以跨层状态 $s_t$ 作为输入,以联合控制动作 $a_t$ 作为输出,并通过奖励函数 $r_t$ 引导策略优化。训练阶段将在联合仿真平台中构建多种 Wi-Fi 网络条件和视觉任务场景,使智能体学习不同网络状态和任务需求下的传输控制策略;验证阶段将与原生 WebRTC/GCC 和 BBR(瓶颈带宽与往返传播时间)基线方法进行对比,并通过消融实验分析 Wi-Fi 状态反馈、WebRTC 帧级信息下传和模型 QoE 反馈对系统性能提升的贡献。
\section{基于联合仿真平台的多场景实验验证}
\subsection{研究内容}
本文将基于前述闭环联合仿真平台,对所提出的WebRTC–Wi-Fi双向跨层协同优化方法进行实验验证。实验将围绕多类实时视觉模型业务场景展开,以验证所提出方法相比其他方案的有效性和泛化能力。具体而言,本文将设计以下几个典型的实时视觉模型业务场景:
\begin{itemize}
\item \textbf{具身智能场景}:在该场景中,机器人作为客户端,通过Wi-Fi连接到VLA服务端。机器人将上传自身摄像头拍摄的第一视角视频,服务端模型根据当前画面生成环境理解、动作建议或控制指令,使得机器人可以完成各种任务。
\item \textbf{实时视频对话场景}:在该场景中,用户使用的对话终端作为客户端,VLM作为服务端。用户通过摄像头与模型进行连续交互,模型需要根据当前视频内容及时生成文本回答。
\item \textbf{异常事件识别场景}:在该场景中,监控摄像头作为客户端,VLM作为服务端。系统需要在连续视频流中及时发现关键事件并返回结果,例如识别异常行为、检测安全隐患或监测设备状态。
\end{itemize}
\subsection{技术路线}
本文拟使用对比实验和消融实验开展实验验证。本文将基于联合仿真平台构建可控的实时视觉模型业务实验环境,构建上述三个不同的场景,并统计模型QoE指标。
在对比实验方面,本文拟将所提出的 WebRTC--Wi-Fi 双向跨层协同优化方法与典型的 GCC 和 BBR 类拥塞控制基线方案进行比较,如表~\ref{tab:1} 所示。通过该组实验,可以评估本文方法相较于当前经典方案的整体优势。
\begin{table}[htbp]
\centering
\caption{对比实验设计}
\label{tab:1}
\begin{tabular}{p{0.18\textwidth} p{0.34\textwidth} p{0.38\textwidth}}
\hline
实验方案 & 方法说明 & 对比目的 \\
\hline
GCC & 采用 WebRTC 默认拥塞控制机制,仅依据端到端 RTT、丢包率和到达时间反馈进行码率调整 & 评估仅依赖端到端反馈的传统实时视频传输方法在动态 Wi-Fi 环境下的性能 \\
\hline
BBR & 采用基于瓶颈带宽和往返时延估计的拥塞控制方法,通过估计网络可用带宽和最小 RTT 来调节发送速率 & 作为模型式拥塞控制基线,评估不依赖传统丢包驱动机制的速率控制方法在实时视觉模型业务中的适用性 \\
\hline
本文方法 & 同时引入 Wi-Fi 状态反馈、WebRTC 帧级信息下传和模型 QoE 驱动的联合决策机制 & 验证双向跨层协同优化相较于传统方法的综合优势 \\
\hline
\end{tabular}
\end{table}
在消融实验方面,本文将分别去除或简化所提出方法中的关键模块,以分析不同机制对最终性能提升的贡献。具体消融实验设计如表~\ref{tab:2} 所示。
\begin{table}[htbp]
\centering
\caption{消融实验设计}
\label{tab:2}
\begin{tabular}{p{0.22\textwidth} p{0.34\textwidth} p{0.34\textwidth}}
\hline
消融方案 & 去除或简化的模块 & 分析目的 \\
\hline
去除 Wi-Fi 状态反馈 & WebRTC 不再获取信道忙碌比例、无线重传率、链路速率和队列状态等 Wi-Fi 底层信息 & 分析 Wi-Fi 显式状态感知对拥塞判断、码率控制和 FEC 调整的贡献 \\
\hline
去除 WebRTC 帧级信息下传 & Wi-Fi 层不再获取视频帧类型、帧级截止时间、数据重要性和冗余属性等信息 & 分析帧级语义信息对 Wi-Fi 队列管理、关键帧保障和过期帧清理的贡献 \\
\hline
去除模型 QoE 反馈 & 优化目标退化为传统网络 QoS 或视频传输质量指标,不再直接考虑模型准确率、TTFT 和 ITL & 分析模型 QoE 驱动优化相较于传统网络指标优化的必要性 \\
\hline
完整方法 & 保留 Wi-Fi 状态反馈、WebRTC 帧级信息下传、模型 QoE 反馈、过期帧清理和 FEC 自适应机制 & 作为消融实验中的完整方案,用于衡量各模块叠加后的综合效果 \\
\hline
\end{tabular}
\end{table}
通过这种方式,可以判断性能提升究竟主要来自Wi-Fi显式状态感知,还是来自WebRTC向Wi-Fi提供的帧级时限和重要性信息,或者来自模型QoE对联合决策的引导,从而解释各个跨层模块对最终性能提升的具体作用。
% 首先,在实验场景构建方面,本文将基于联合仿真平台搭建可控的实时视觉模型业务实验环境。客户端侧负责视频采集、WebRTC 发送和任务请求生成;ns-3 侧负责模拟 Wi-Fi 网络中的信道竞争、速率变化、重传、排队和丢包过程;服务端侧部署 VLM/VLA 推理服务,接收视频输入并返回模型响应。通过调整 Wi-Fi 信道条件、背景流量数量、竞争终端数量和视频输入配置,构建从轻载到重载、从稳定链路到动态链路的多种实验场景。
% 在每类场景中,本文将设置不同Wi-Fi网络条件,包括信道质量变化、背景流量干扰、多终端竞争、链路容量波动和队列拥塞等,以模拟实时视觉业务在无线接入环境中可能遇到的典型问题。实验首先将本文方法与现有代表性方案进行对比,包括原生WebRTC/GCC方案、传统基于端到端反馈的WebRTC优化方案,以及面向实时业务的Wi-Fi侧QoS或队列优先级优化方案。通过这些对比,可以评价本文方法相比传统传输层自适应方法和单独Wi-Fi侧优化方法,在网络传输、视频质量和模型服务效果方面是否具有整体优势。
% 在完成与外部基线方案的总体对比后,本文将进一步开展消融实验,用于分析本文方法内部不同机制的贡献。消融实验将分别去除或简化Wi-Fi状态反馈、WebRTC帧级信息下传和模型QoE反馈三个模块,观察系统性能变化。通过这种方式,可以判断性能提升究竟主要来自Wi-Fi显式状态感知,还是来自WebRTC向Wi-Fi提供的帧级时限和重要性信息,或者来自模型QoE对联合决策的引导。这样既能够证明本文方法相较于现有方案的有效性,也能够解释各个跨层模块对最终性能提升的具体作用。