\chapter{研究内容与方法} 本文围绕 WiFi 网络中实时视觉模型推理业务的传输优化问题展开研究。具体而言,本文研究内容包括四个层次:首先构建能够运行真实视觉模型业务的系统级联合仿真平台,为后续实验提供可控、可重复的环境;其次利用该平台分析WiFi网络状态、WebRTC 传输行为和视觉模型任务性能之间的跨层关联;然后在关联分析的基础上设计面向视觉任务需求的 WebRTC–WiFi 联合优化方法;最后通过在不同场景下的实验验证所提出方法的有效性。接下来将详细介绍每个层次的研究内容和方法。 \section{系统模型} \subsection{网络拓扑与业务场景} 如图~\ref{fig:system_model}所示,本文考虑一个由单接入点(AP)与 $N$ 个终端(STA)构成的边缘WiFi推理网络。视觉语言模型(VLM)或视觉语言动作模型(VLA)部署于AP侧,各STA通过WiFi链路向AP发起实时视频推理请求,形成"终端采集—无线传输—边缘推理—结果返回"的闭环服务链路。为模拟不同程度的网络拥塞,本文将在后续实验中引入WiFi同频干扰作为背景流量,以构造从轻载到重载的多种无线信道条件。 \begin{figure}[!h] \centering \includegraphics[width=0.6\linewidth]{figure/毕业论文-系统场景.pdf} \caption{研究场景} \label{fig:system_model} \end{figure} \subsection{基本假设} 为聚焦核心问题,本文明确以下研究假设:(1)AP 具备充足的边缘算力以部署 VLM 或 VLA 模型,推理请求到达后立即置入模型 batch 中处理;(2)各 STA 部署有实时视频推理客户端,通过 WiFi 网络接入 AP,其中视频流采用 WebRTC 协议传输,任务请求与推理结果采用 WebSocket 协议传输;(3)WebRTC 内置的拥塞控制算法(如 GCC)根据网络状态动态调节视频编码码率——码率越低,视频压缩质量越差,同时码率选择也会反向影响 WiFi 上行队列的排队时延,形成传输质量与时延之间的耦合;(4)假设模型流式响应的每个chunk中只包含一个token。 \subsection{通信与推理流程} 在上述假设下,一次完整的实时视觉推理请求经历以下阶段:首先,终端通过 WebRTC 持续上传实时视频流,在需要服务时,终端通过 WebSocket 向 AP 发送文本形式的任务请求;同时;AP 在收到请求时,采样最近的视频帧,并调用已部署的 VLM/VLA 模型进行在线推理;最后,模型以流式方式逐token生成响应,并通过 WebSocket 回传至请求终端,直至推理结束。 \subsection{优化指标} 本文将视觉模型推理服务的用户体验质量(QoE)定义为\textbf{准确度}与\textbf{响应及时性}两个维度的综合度量。响应及时性由首 Token 响应时间(Time to First Token, TTFT)和 Token 间延迟(Inter-Token Latency, ITL)两个指标刻画。其中,TTFT 定义为从请求发出到终端收到首个 token的时间间隔,它同时涵盖了上行传输、模型推理和下行传输三个环节,是反映端到端响应速度的综合指标。ITL 定义为相邻两次 token(或 chunk)到达终端的时间间隔,反映模型输出的流畅程度。由于模型以 chunk 方式批量输出,ITL 同时受到模型生成速度和下行批量发送行为的双重影响,难以简单拆分为推理时延与传输时延。为全面刻画 ITL 的分布特征,本文不仅关注 ITL 的均值,也关注其高分位数(如 $P_{90}$、$P_{95}$),以捕捉影响交互连贯性的尾部延迟。 准确度方面,模型推理的准确度衡量输出结果与真实期望的吻合程度,其具体计算方法因任务类型而异(例如具身智能中的任务成功率、视频问答中的答案正确率等),后续研究将分别定义。 \subsection{优化问题描述} 综合上述分析,本文的核心研究问题可表述为:在单 AP、多 STA 的 WiFi 网络环境中,通过协同调节 WebRTC 层的传输策略(码率、FEC 冗余率、帧率、分辨率等)与 WiFi MAC 层的调度策略(队列优先级、过期帧清理阈值等),最大化视觉模型推理服务的综合 QoE。该优化问题可概括为: \begin{equation} \max_{\pi}\ \mathbb{E}\left[\,\mathcal{Q}\big(Acc,\ TTFT,\ \overline{ITL},\ P_{95}(ITL)\big)\,\right] \end{equation} 其中 $\pi$ 表示跨层协同控制策略,$\mathcal{Q}(\cdot)$ 为准确度与及时性指标的效用聚合函数。后续章节将围绕该目标,依次开展仿真平台构建、跨层关联分析和联合优化方法设计等工作。 \section{面向实时视觉模型业务的闭环联合仿真平台} % 本文首先研究如何构建一个能够支撑真实实时视觉模型业务的无线通信联合仿真平台。 \subsection{研究内容} 实时视觉模型业务具有视频持续输入、模型在线推理和结果实时返回等特点,如果仅使用预先生成的流量模型或离线网络轨迹,难以准确反映网络变化对模型任务结果的影响,并且考虑到可复现性和可分析性,本研究最终决定使用半实物仿真来支撑后续的分析和研究。现有仿真平台难以同时满足真实业务闭环、WiFi 细粒度仿真和可复现实验需求,因此本研究决定首先建立一个能够同时包含真实业务逻辑、WebRTC传输过程和WiFi网络仿真的闭环仿真实验平台。 该平台以ns-3作为WiFi网络仿真基础,用于模拟客户端与服务端之间的无线通信过程。ns-3能够较细粒度地描述WiFi网络中的信道竞争、调制编码方式、无线重传、队列变化和多终端接入等现象,适合用于研究无线网络状态对实时业务的影响。同时,平台使用ns3-ai模块提供的共享内存通信机制,将ns-3仿真进程与外部真实应用进程连接起来,使仿真网络不再只是处理预设模型产生的流量,而是可以承载真实应用产生的视频流和业务请求。本研究力求将该框架构建成一个通用的联合仿真平台,因此并不假定GenAI客户端和GenAI服务端的具体实现,而是提供标准化的接口。这意味着GenAI客户端可以是任何能够发送请求的仿真器(例如Maniskill等机器人仿真器)或实物,GenAI服务端可以是任何能够接收请求并返回结果的模型——这意味着本研究既可以部署LLM/VLM等真实模型,也可以使用现成的流量模型,甚至可以支持LLM ServingSim等专门的模型推理仿真器。通过这种设计,平台能够适应不同的研究需求和实验场景,具有较强的灵活性和扩展性。 \subsection{技术路线} \begin{figure}[!h] \centering \includegraphics[width=0.6\linewidth]{figure/ns3agent-overview-zh.pdf} \caption{面向GenAI业务的联合仿真平台} \label{fig:ns3agent-overview} \end{figure} 如图~\ref{fig:ns3agent-overview}所示,在平台运行过程中,客户端连接视频采集与请求程序,将实时视频流以及任务请求送入 ns-3仿真的网络中。ns-3将视频流通过WebRTC协议发送到WiFi网络中,并模拟视频分组在无线链路中的传输过程,包括排队、竞争、重传、丢包和时延变化。服务端连接已经部署好的视觉语言模型或视觉语言动作模型服务,在接收到视频流和请求后完成推理,并将模型生成的文本响应、决策结果或控制指令通过同一仿真网络返回客户端。由此,平台形成从客户端输入、无线网络传输、模型推理到结果返回的完整闭环。 该平台的关键难点在于联合仿真的时间同步和时序因果一致性。ns-3采用离散事件仿真机制,内部按照仿真时间推进,而外部视频客户端和模型服务器运行在真实时间中。如果两者之间缺少严格的同步机制,就会出现事件的时序因果错误。以GenAI客户端与ns-3网络之间的二分交互为例:假设初始时间点为$t_0$,客户端计划在未来的时间点$t_1$向ns-3发送请求。为避免因果性违规,客户端必须在$t_1$准确暂停,并确保ns-3的仿真时间尚未推进到$t_1$之后,然后在客户端和ns-3的时间都到达$t_1$时,客户端才能将请求发送到ns-3中。 作为联合仿真的一个经典问题,本研究参考High Level Architecture(HLA)同步机制的实现,设计了一种基于前瞻量的保守时间同步机制。此机制要求GenAI客户端/服务端和ns-3仿真器在每次同步事件中交换当前时间和前瞻承诺(Lookahead)参数,以独立计算下一个安全同步点,从而确保双方都能安全地推进时间而不违反时序因果性。所谓前瞻量可以理解为一个严格的时间承诺,即在当前时间点$T_k$加上前瞻值$TL_{k}$之前,相关仿真器绝对不会生成任何面向另一个仿真器的新事件或数据。 \begin{figure} \centering \includegraphics[width=0.6\linewidth]{figure/time_syn.pdf} \caption{联合仿真时间同步示意图} \label{fig:time_syn} \end{figure} 如图~\ref{fig:time_syn}所示,在每次同步事件中,外部仿真器(如GenAI客户端)与ns-3网络环境之间会进行一次双向数据交换。客户端将其当前仿真时间记为$T_k$,并将其前瞻承诺记为$TL_{k}^{(c)}$发送给ns-3。前瞻值$TL_{k}^{(c)}$作为一项严格保证,确保客户端在$T_k + TL_{k}^{(c)}$之前绝对不会生成任何面向ns-3网络的新事件或数据。与此同时,ns-3仿真器也将其当前时间$T_k$及其前瞻值$TL_{k}^{(n)}$发送给客户端。基于这些交换的参数,系统使用以下公式独立计算所有交互域之间的下一个安全同步点$T_{k+1}$: \begin{equation} T_{k+1}=T_k+\min\left(TL_{k}^{(c)}, TL_{k}^{(n)}\right), \end{equation} 从而确保两个仿真器可以安全地将各自本地时钟推进至$T_{k+1}$,而不会违反时序因果性。 该研究产出一个面向通用智能体AI工作流的跨平台联合仿真框架,支持真实视觉模型业务的闭环仿真。该平台不仅能够用于分析WiFi网络状态、WebRTC传输行为和视觉模型QoE指标之间的关系,还能够为后续设计多种GenAI业务场景提供支持。因此后续本文可以利用该平台模拟出具身智能、AI视频问答等多种GenAI业务场景,并在此基础上分析不同网络状态下视觉模型任务的性能表现,为后续的优化方法设计提供数据支持和理论依据。 \section{WiFi、WebRTC和视觉模型QoE指标的跨层关联分析} 在完成联合仿真平台的基础上,本文进一步研究WiFi网络状态、WebRTC视频传输行为和视觉模型QoE指标之间的关联关系。该部分的核心目标是为了探究不同WiFi网络中的链路变化究竟会通过什么机制影响WebRTC视频传输,并进一步影响实时视觉模型的QoE指标。 \subsection{研究内容} 本文拟首先分析 WiFi 状态对 WebRTC 传输行为的影响。在 WiFi 网络中,信道竞争、链路速率变化、无线重传和队列积压会改变端到端时延、丢包率、抖动和可用带宽,从而影响 WebRTC 的带宽估计、码率调整、FEC 冗余配置和视频帧传输时延。本文将通过实验分析不同 WiFi 底层状态变化是否会导致 WebRTC 拥塞控制产生滞后、误判或过度保守等现象。 另外,本文拟分析 WebRTC 视频传输行为对视觉模型QoE指标的影响。对于实时视觉模型业务,视频质量下降并不一定直接等价于模型性能下降,不同任务对视频分辨率、帧率、关键帧丢失、帧完成时延和输入帧新鲜度的敏感程度可能不同。例如,文字识别和细粒度目标识别任务可能更依赖空间细节,异常事件识别任务可能更依赖时间连续性,实时视频问答和机器人感知任务则可能更加关注输入帧新鲜度和模型响应及时性。因此,本文将比较不同视频传输质量和不同任务类型下模型准确率、任务成功率、TTFT 和 ITL 分布的变化规律。 \subsection{技术路线} 本文将基于联合仿真平台开展多因素控制实验。实验中将 WiFi 网络条件、WebRTC 传输配置和视觉任务类型作为主要实验变量,并同步采集 WiFi 层、WebRTC 层和模型任务层的观测指标。具体实验变量与观测指标如表~\ref{tab:3} 所示。 \begin{table}[htbp] \centering \small \caption{跨层关联分析的实验变量与观测指标} \label{tab:3} \begin{tabular}{p{0.18\textwidth} p{0.36\textwidth} p{0.36\textwidth}} \hline 层次 & 实验变量或观测指标& 分析目的 \\ \hline WiFi 层 & 信道质量、背景流量强度、竞争终端数量、信道忙碌比例、MCS、无线重传率、队列长度、竞争时延等 & 分析无线链路状态和接入竞争对端到端传输行为的影响 \\ \hline WebRTC 层 & 发送码率、目标码率、带宽估计值、RTT、丢包率、抖动、FEC 冗余率、视频帧大小、关键帧比例、帧完成传输时延、发送队列状态等 & 分析 WebRTC 自适应传输行为及其对视频帧质量、时延和新鲜度的影响 \\ \hline 模型任务层 & 任务准确率、任务成功率、TTFT、ITL 均值、ITL 高分位数、模型响应完成时延、输入帧新鲜度、过期帧比例等 & 分析网络和视频传输变化对最终模型服务质量的影响 \\ \hline \end{tabular} \end{table} 在数据分析方法上,本文拟采用统计分析和数据驱动建模相结合的方式。首先,通过相关性分析、分组对比和敏感性分析,识别哪些 WiFi 状态和 WebRTC 传输指标与模型准确率、TTFT 和 ITL 变化关系最为密切。其次,通过多变量回归、决策树或轻量级机器学习模型,建立从跨层状态到模型 QoE 的预测关系,用于判断不同网络状态和传输行为对模型任务效果的影响程度。最后,针对不同视觉任务分别分析关键影响因素,形成任务类型与传输敏感因素之间的对应关系。 该部分研究预期形成三类结果。第一,获得 WiFi 底层状态对 WebRTC 拥塞控制、码率调整和视频帧传输时延的影响规律;第二,获得视频传输质量、帧新鲜度和模型任务准确率、TTFT、ITL 之间的关联关系;第三,筛选出对模型 QoE 影响显著的跨层状态和控制变量,为后续强化学习优化方法中的状态空间、动作空间和奖励函数设计提供依据。通过该部分研究,本文将从实验数据层面说明为什么需要进行 WebRTC--WiFi 双向跨层协同优化,以及联合优化应重点关注哪些网络状态、视频传输参数和模型服务质量指标。 \section{面向视觉模型服务质量的WebRTC–WiFi联合优化方法} 在完成跨层关联分析之后,本文将进一步研究面向视觉模型服务质量的 WebRTC–WiFi 双向跨层协同优化方法。与传统实时视频传输优化主要关注网络吞吐量、端到端时延、丢包率或人类观看体验不同,本文拟将视觉模型任务的QoE作为最终优化目标。在此基础上,本文拟从研究内容和技术路线两个方面开展工作。 \subsection{研究内容} 本文拟建立 WebRTC 与 WiFi 之间的双向跨层信息交互机制。 \textbf{(1)WiFi状态辅助的WebRTC拥塞控制与FEC策略: }使 WebRTC 能够感知 WiFi 层的信道竞争、无线重传、链路速率变化和队列积压等底层状态,从而辅助其进行码率调整、发送节奏控制和 FEC 冗余配置。相比仅依赖端到端 RTT、丢包率和带宽估计的传统 WebRTC 控制方式,引入 WiFi 显式状态有助于减少无线环境下拥塞判断的滞后和误判。 \textbf{(2)WebRTC帧级信息驱动的WiFi队列管理: }使 WiFi 层能够感知 WebRTC 提供的视频帧级信息,包括帧类型、帧级截止时间、数据重要性、FEC 冗余属性和过期状态等。基于这些信息,WiFi 层可以在队列管理和分组调度过程中对不同数据进行差异化处理。例如,对关键帧和高重要性数据包给予更高传输优先级,对已经超过任务截止时间的过期帧进行及时清理,对 FEC 冗余数据根据当前链路状态和主数据包传输情况动态调整优先级。通过这种方式,WiFi 层不再无差别传输所有视频数据,而是能够围绕视觉模型任务需求进行无线资源分配。 % 因此,本文拟将WebRTC中的视频帧类型、帧级截止时间、数据包所属帧的重要性、冗余数据标识和过期状态等信息传递给WiFi层,使WiFi能够根据视频数据的实时价值进行差异化处理。在无线队列资源有限或信道竞争严重时,WiFi可以优先保障关键帧和高重要性数据包;对于已经超过截止时间的过期帧,可以将其对应的数据包从WiFi队列中清除,以减少无效传输和队列阻塞;对于FEC冗余数据,可以根据当前链路状态和主数据包传输情况动态调整其优先级。这样,WiFi层不再只是被动传输WebRTC注入的所有数据,而是能够根据WebRTC提供的帧级语义、时限和冗余信息进行更加有效的无线资源分配。 \textbf{(3)模型QoE驱动的跨层联合决策: }在双向跨层信息交互的基础上,本文拟将 WiFi 状态感知、WebRTC 帧级信息下传和模型服务质量反馈结合起来,形成面向实时视觉模型推理业务的跨层协同优化机制,使系统能够在视频质量、传输时延、帧新鲜度和无线资源利用之间进行联合权衡,从而提升模型任务准确率并降低模型任务响应时延。 % 在双向跨层信息交互的基础上,本文将视觉模型的QoE作为联合优化目标。这里的QoE主要包括模型任务准确率、响应时延、输入信息新鲜度、任务成功率和推理稳定性等指标。本文将模型QoE作为上层反馈信号,用于指导WebRTC在码率、FEC冗余率等方面进行调整。通过这种方式,系统能够使跨层传输策略更接近实时视觉模型服务的最终需求。具体而言,如果任务本身对图像清晰度并没有很高的要求,那么系统就不必追求高码率视频,而分配更多资源满足模型对实时性的需求,反之亦然。 % 具体而言,当模型准确率对空间细节较为敏感时,系统可以在网络允许的范围内优先保障较高分辨率或关键帧质量;当模型任务更加依赖实时性时,系统可以优先降低排队时延和过期帧比例,而不是盲目提高视频码率;当网络状态恶化时,系统可以根据模型QoE下降程度判断码率、冗余率和队列策略的调整幅度。由此,WebRTC和WiFi的联合优化不再仅以吞吐量、丢包率或传统视频QoE为目标,而是直接围绕实时视觉模型的最终服务效果进行决策。 \subsection{技术路线} 本文拟将 WebRTC–WiFi 联合优化问题建模为一个面向模型 QoE 的序贯决策问题。系统以固定控制周期运行,在每个控制周期内采集 WiFi 层、WebRTC 层和模型任务层的跨层状态,并根据当前状态选择下一阶段的传输控制和无线调度动作。该问题可表示为马尔可夫决策过程,其中状态空间、动作空间和奖励函数分别设计如下。 首先,状态空间 $s_t$ 由 WiFi 层状态、WebRTC 层状态和模型任务层状态共同组成: \begin{equation} s_t = \left[s_t^{wifi}, s_t^{rtc}, s_t^{model}\right] \end{equation} 其中,WiFi 层状态 $s_t^{wifi}$ 用于描述无线链路和接入竞争情况,主要包括信道忙碌比例、物理层速率或 MCS、无线重传率、发送队列长度、队列等待时延、竞争时延和背景流量强度等。WebRTC 层状态 $s_t^{rtc}$ 用于描述端到端视频传输行为,主要包括当前发送码率、目标码率、带宽估计值、RTT、丢包率、抖动、FEC 冗余率、视频帧大小、关键帧比例、视频帧完成传输时延和发送队列状态等。模型任务层状态 $s_t^{model}$ 用于描述视觉模型业务的服务质量,主要包括近期模型任务准确率、首 token 响应时间(Time to First Token, TTFT)、输出 token 间隔(Inter-Token Latency, ITL)的均值和高分位数等。 其次,动作空间 $a_t$ 由 WebRTC 侧控制动作和 WiFi 侧调度动作组成: \begin{equation} a_t = \left[a_t^{rtc}, a_t^{wifi}\right] \end{equation} 其中,WebRTC 侧动作 $a_t^{rtc}$ 主要包括目标码率调整、发送节奏调整、FEC 冗余率调整、视频帧率调整和分辨率等级调整等。WiFi 侧动作 $a_t^{wifi}$ 主要包括关键帧优先级调整、普通帧优先级调整、FEC 冗余包优先级调整、过期帧清理阈值调整以及不同队列的调度权重调整等。考虑到连续动作空间会增加训练难度,本文初步拟采用离散化动作集合,例如对码率、FEC 冗余率、帧率和队列优先级分别设置“提高、保持、降低”三类动作,并根据后续实验结果进一步扩展为更细粒度的连续控制。 最后,奖励函数以模型 QoE 为核心进行设计。本文重点关注模型任务准确率和模型任务响应时延,其中响应时延包括 TTFT 和 ITL 的分布特征。对于第 $t$ 个控制周期,奖励函数可设计为: \begin{equation} r_t = \alpha \widetilde{A}t -\beta_1 \widetilde{L}{t}^{TTFT} -\beta_2 \widetilde{L}{t}^{ITL} -\beta_3 \widetilde{F}{t}^{stale} -\beta_4 \widetilde{C}_{t}^{overhead} \end{equation} 其中,$\widetilde{A}t$ 表示归一化后的模型任务准确率或任务成功率,$\widetilde{L}{t}^{TTFT}$ 表示归一化后的 TTFT 时延惩罚,$\widetilde{L}{t}^{ITL}$ 表示归一化后的 ITL 时延惩罚,$\widetilde{F}{t}^{stale}$ 表示输入视频帧过期或新鲜度下降带来的惩罚,$\widetilde{C}_{t}^{overhead}$ 表示过高码率、过高 FEC 冗余或过度占用无线资源带来的系统开销。$\alpha,\beta_1,\beta_2,\beta_3,\beta_4$ 为权重参数,可根据不同任务类型进行设置。 由于 ITL 的尾部时延会直接影响模型输出的连续性和交互稳定性,本文不仅考虑 ITL 的平均值,也将考虑其高分位数,例如 90 分位数或 95 分位数。因此,$\widetilde{L}_{t}^{ITL}$ 可以设计为 ITL 的均值和高分位数的加权组合,以同时反映整体时延水平和长尾时延风险。 基于上述建模,本文拟采用强化学习方法学习跨层控制策略。强化学习智能体以跨层状态 $s_t$ 作为输入,以联合控制动作 $a_t$ 作为输出,并通过奖励函数 $r_t$ 引导策略优化。训练阶段将在联合仿真平台中构建多种 WiFi 网络条件和视觉任务场景,使智能体学习不同网络状态和任务需求下的传输控制策略;验证阶段将与原生 WebRTC/GCC 和 BBR(瓶颈带宽与往返传播时间)基线方法进行对比,并通过消融实验分析 WiFi 状态反馈、WebRTC 帧级信息下传和模型 QoE 反馈对系统性能提升的贡献。 \section{基于联合仿真平台的多场景实验验证} \subsection{研究内容} 本文将基于前述闭环联合仿真平台,对所提出的WebRTC–WiFi双向跨层协同优化方法进行实验验证。实验将围绕多类实时视觉模型业务场景展开,以验证所提出方法相比其他方案的有效性和泛化能力。具体而言,本文将设计以下几个典型的实时视觉模型业务场景: \begin{itemize} \item \textbf{具身智能场景}:在该场景中,机器人作为客户端,通过WiFi连接到VLA服务端。机器人将上传自身摄像头拍摄的第一视角视频,服务端模型根据当前画面生成环境理解、动作建议或控制指令,使得机器人可以完成各种任务。 \item \textbf{实时视频对话场景}:在该场景中,用户使用的对话终端作为客户端,VLM作为服务端。用户通过摄像头与模型进行连续交互,模型需要根据当前视频内容及时生成文本回答。 \item \textbf{异常事件识别场景}:在该场景中,监控摄像头作为客户端,VLM作为服务端。系统需要在连续视频流中及时发现关键事件并返回结果,例如识别异常行为、检测安全隐患或监测设备状态。 \end{itemize} \subsection{技术路线} 本文拟使用对比实验和消融实验开展实验验证。本文将基于联合仿真平台构建可控的实时视觉模型业务实验环境,构建上述三个不同的场景,并统计模型QoE指标。 在对比实验方面,本文拟将所提出的 WebRTC--WiFi 双向跨层协同优化方法与典型的 GCC 和 BBR 类拥塞控制基线方案进行比较,如表~\ref{tab:1} 所示。通过该组实验,可以评估本文方法相较于当前经典方案的整体优势。 \begin{table}[htbp] \centering \caption{对比实验设计} \label{tab:1} \begin{tabular}{p{0.18\textwidth} p{0.34\textwidth} p{0.38\textwidth}} \hline 实验方案 & 方法说明 & 对比目的 \\ \hline GCC & 采用 WebRTC 默认拥塞控制机制,仅依据端到端 RTT、丢包率和到达时间反馈进行码率调整 & 评估仅依赖端到端反馈的传统实时视频传输方法在动态 WiFi 环境下的性能 \\ \hline BBR & 采用基于瓶颈带宽和往返时延估计的拥塞控制方法,通过估计网络可用带宽和最小 RTT 来调节发送速率 & 作为模型式拥塞控制基线,评估不依赖传统丢包驱动机制的速率控制方法在实时视觉模型业务中的适用性 \\ \hline 本文方法 & 同时引入 WiFi 状态反馈、WebRTC 帧级信息下传和模型 QoE 驱动的联合决策机制 & 验证双向跨层协同优化相较于传统方法的综合优势 \\ \hline \end{tabular} \end{table} 在消融实验方面,本文将分别去除或简化所提出方法中的关键模块,以分析不同机制对最终性能提升的贡献。具体消融实验设计如表~\ref{tab:2} 所示。 \begin{table}[htbp] \centering \caption{消融实验设计} \label{tab:2} \begin{tabular}{p{0.22\textwidth} p{0.34\textwidth} p{0.34\textwidth}} \hline 消融方案 & 去除或简化的模块 & 分析目的 \\ \hline 去除 WiFi 状态反馈 & WebRTC 不再获取信道忙碌比例、无线重传率、链路速率和队列状态等 WiFi 底层信息 & 分析 WiFi 显式状态感知对拥塞判断、码率控制和 FEC 调整的贡献 \\ \hline 去除 WebRTC 帧级信息下传 & WiFi 层不再获取视频帧类型、帧级截止时间、数据重要性和冗余属性等信息 & 分析帧级语义信息对 WiFi 队列管理、关键帧保障和过期帧清理的贡献 \\ \hline 去除模型 QoE 反馈 & 优化目标退化为传统网络 QoS 或视频传输质量指标,不再直接考虑模型准确率、TTFT 和 ITL & 分析模型 QoE 驱动优化相较于传统网络指标优化的必要性 \\ \hline 完整方法 & 保留 WiFi 状态反馈、WebRTC 帧级信息下传、模型 QoE 反馈、过期帧清理和 FEC 自适应机制 & 作为消融实验中的完整方案,用于衡量各模块叠加后的综合效果 \\ \hline \end{tabular} \end{table} 通过这种方式,可以判断性能提升究竟主要来自WiFi显式状态感知,还是来自WebRTC向WiFi提供的帧级时限和重要性信息,或者来自模型QoE对联合决策的引导,从而解释各个跨层模块对最终性能提升的具体作用。 % 首先,在实验场景构建方面,本文将基于联合仿真平台搭建可控的实时视觉模型业务实验环境。客户端侧负责视频采集、WebRTC 发送和任务请求生成;ns-3 侧负责模拟 WiFi 网络中的信道竞争、速率变化、重传、排队和丢包过程;服务端侧部署 VLM/VLA 推理服务,接收视频输入并返回模型响应。通过调整 WiFi 信道条件、背景流量数量、竞争终端数量和视频输入配置,构建从轻载到重载、从稳定链路到动态链路的多种实验场景。 % 在每类场景中,本文将设置不同WiFi网络条件,包括信道质量变化、背景流量干扰、多终端竞争、链路容量波动和队列拥塞等,以模拟实时视觉业务在无线接入环境中可能遇到的典型问题。实验首先将本文方法与现有代表性方案进行对比,包括原生WebRTC/GCC方案、传统基于端到端反馈的WebRTC优化方案,以及面向实时业务的WiFi侧QoS或队列优先级优化方案。通过这些对比,可以评价本文方法相比传统传输层自适应方法和单独WiFi侧优化方法,在网络传输、视频质量和模型服务效果方面是否具有整体优势。 % 在完成与外部基线方案的总体对比后,本文将进一步开展消融实验,用于分析本文方法内部不同机制的贡献。消融实验将分别去除或简化WiFi状态反馈、WebRTC帧级信息下传和模型QoE反馈三个模块,观察系统性能变化。通过这种方式,可以判断性能提升究竟主要来自WiFi显式状态感知,还是来自WebRTC向WiFi提供的帧级时限和重要性信息,或者来自模型QoE对联合决策的引导。这样既能够证明本文方法相较于现有方案的有效性,也能够解释各个跨层模块对最终性能提升的具体作用。