Files
mcx_kaiti/text/02_related_work.tex
T

66 lines
22 KiB
TeX

\chapter{国内外研究概况及发展趋势}
面向实时视觉模型推理的无线传输优化涉及模型任务、视频传输和无线接入等多个层面的协同。现有研究尚未形成完整的WebRTC–Wi-Fi–视觉模型闭环优化框架,但已从四个相关方向展开探索:一是实时视觉大模型的流式推理与通信需求研究,主要关注连续视频输入、在线理解和边缘推理;二是面向视频类AI的视频传输优化研究,主要关注如何根据视频内容和模型反馈调整帧率、分辨率、传输区域与带宽分配;三是WebRTC优化研究,主要围绕拥塞控制、速率调节和FEC等传输机制展开;四是Wi-Fi实时业务优化研究,主要关注无线状态感知、资源调度和低时延保障。本章按照上述顺序梳理相关工作的主要进展,并在此基础上归纳现有研究在跨层协同和模型任务导向优化方面的不足。
\section{实时视觉大模型通信需求研究}
随着多模态大模型的发展,视觉理解任务正在从离线图像理解和离线视频问答,逐渐转向连续视频流上的在线感知、实时问答和具身交互。在传统离线视频理解任务中,模型通常可以在完整视频已经采集和存储之后再进行推理;而在实时视觉大模型业务中,视频数据仍在不断产生,模型需要在有限时延内持续接收最新视觉输入,并结合当前场景、历史上下文和用户指令生成响应。因此,这类业务不再只是模型结构或推理效率问题,而是同时依赖视频采集、编码压缩、无线传输、边缘计算和模型推理之间的协同。本节将从流式模型能力、在线视频理解评测和边缘具身应用三个方面梳理相关研究,并进一步说明实时视觉模型业务对无线视频传输提出的新需求。
从模型能力演进来看,近期研究已经开始从离线视频理解转向连续视频输入和在线响应能力。VideoLLM-online提出Learning-In-Video-Stream框架,使视频大语言模型能够在持续接收视频流的过程中进行时间对齐理解和实时对话\cite{chen_videollm-online_2024}。LiveVLM和StreamingVLM等工作进一步面向实时或近无限视频流提出流式KV缓存和紧凑记忆机制,以支持模型在长时间视频输入下维持较低响应延迟\cite{ning_livevlm_2025,xu_streamingvlm_2025}。VideoScan和Mobile-VideoGPT则分别从帧级语义压缩、关键帧选择和视觉token裁剪等角度降低视频理解过程中的计算和显存开销\cite{li_videoscan_2025,shaker_mobilevideogpt_2025}。这些研究共同说明,实时视觉大模型已经不再只关注“能否理解完整视频”,而是开始关注“能否在视频持续到达的过程中及时理解和响应”。相应地,模型对输入视频帧的新鲜度、连续性和有效信息保留提出了更高要求。
从评测基准和数据集的发展来看,实时视觉大模型的研究目标也正在由离线长视频理解转向在线、流式和时间敏感的视频理解。Video-MME、LongVideoBench和MLVU等基准主要推动多模态大模型处理更长、更复杂的视频输入,要求模型能够在长时间、多事件和多语义线索的视频中进行检索与推理\cite{fu_video-mme_2025,wu_longvideobench_2024,zhou_mlvu_2025}。在此基础上,OVBench、OVO-Bench和StreamingBench进一步强调在线视频理解中的当前场景感知、历史信息记忆、未来事件预测和时间点触发响应能力\cite{huang_ovbench_2025,niu_ovo-bench_2025,lin_streamingbench_2024}。这些基准的变化表明,实时视觉模型的能力评估已经不再局限于“看完整段视频后回答问题”,而是逐渐转向“边看边理解、边交互边响应”。因此,视频帧是否能够及时、连续、稳定地传输到模型侧,将直接影响模型在线感知和实时响应能力的发挥。
从应用场景来看,实时视觉大模型正在向机器人、移动终端、可穿戴设备和具身智能系统扩展,这进一步强化了其通信需求。RT-2和OpenVLA将视觉语言模型扩展到机器人动作决策和通用操作策略,使模型能够根据视觉观测和语言指令生成控制行为\cite{brohan_rt2_2023,kim_openvla_2024};EgoLife面向AI眼镜和第一人称日常生活助手构建长时间、多模态视频数据集,反映了视觉模型持续感知环境并提供实时辅助的应用趋势\cite{yang_egolife_2025}。由于VLM/VLA通常具有较高计算和显存开销,许多应用需要借助边缘或云端算力。Ahmad等人在O-RAN/MEC环境中部署VLM,并设计基于WebRTC的多模态数据流传输管线,将机器人采集的视频传输到边缘节点进行实时感知推理\cite{ahmad_vision-language_2026}。这些应用说明,实时视觉模型的输入往往需要经过无线网络传输到边缘或云端,传输时延、连续性和视频质量会直接影响模型获得的视觉信息及其输出质量。
总体而言,实时视觉大模型正在从离线视频理解走向连续视频流上的在线感知、实时问答和具身交互,并越来越多地依赖边缘或云端推理。与面向人类观看的视频业务相比,这类业务更关注任务准确率、响应及时性和输入信息新鲜度,不同任务对清晰度、帧率和时序连续性的敏感程度也可能不同。因此,传统网络QoS或人类视频QoE指标未必能够准确反映模型任务质量。现有研究的重点仍主要集中在模型结构、视觉token压缩、流式记忆和推理效率,对无线网络状态及传输自适应行为如何影响模型任务质量缺少系统分析。
\section{面向视频类 AI 的视频传输优化研究}
除实时视觉大模型本身的流式推理研究外,近年来也有一类工作开始从“机器理解视频”而非“人类观看视频”的角度重新设计视频传输机制。早期面向视频分析的研究已经指出,传统视频流传输通常以人类观看体验为目标,难以直接适配目标检测、识别和场景理解等 DNN 推理任务。Pakha 等人较早提出应面向分布式视觉分析重新设计视频流传输协议,使其优化目标从人眼感知质量转向分析准确率与带宽开销之间的权衡\cite{pakha2018reinventing}。AWStream 进一步面向广域流式分析场景,通过在帧率、分辨率和数据压缩等多个维度上进行自适应降级,在带宽受限时维持应用级分析准确率和数据新鲜度\cite{zhang2018awstream}。Chameleon 则针对大规模视频分析系统,利用时间和跨摄像头相关性动态选择视频分辨率、帧率和模型配置,以在资源消耗和分析准确率之间取得平衡\cite{jiang2018chameleon}。这些工作表明,视频类 AI 业务中的传输优化不能简单等同于传统视频 QoE 优化,而应结合模型任务对输入质量的敏感性进行设计。
在边缘视频分析场景中,后续研究进一步将视频传输与服务端模型推理过程结合起来。DDS 提出服务端驱动的视频流传输机制,先传输低质量视频流,由服务端 DNN 根据检测结果决定哪些区域需要以更高质量重新传输,从而在降低带宽消耗的同时保持或提升推理准确率\cite{du2020dds}。CASVA 则针对实时视频分析中的配置选择问题,根据视频内容、网络带宽和推理准确率之间的关系,自适应选择分辨率、帧率和模型配置,以提升实时分析任务在带宽变化下的稳定性\cite{zhang2022casva}。Runespoor 面向机器人边缘-云视觉分析提出内容自适应数据率控制机制,在受限带宽下改善机器人视觉任务的尾部准确率\cite{wang_runespoor_2021}。这些研究共同说明,面向视频类 AI 的传输优化已经逐渐从单纯压缩视频码流,发展为结合视频内容、模型反馈和任务准确率的联合优化问题。
近期,多模态大模型视频助手的出现进一步推动了面向 MLLM 的实时视频通信优化研究。Wu 等人指出,在 AI Video Chat 场景中,实时通信的一端不再是人类用户,而是部署在云端或边缘侧的多模态大模型,因此传统 RTC 中以人眼感知质量、播放流畅性和卡顿率为核心的 QoE 指标不再完全适用,系统更应关注 MLLM 响应准确率和端到端交互时延\cite{wu2025chatwithai}。在此基础上,Artic 提出面向 MLLM Video Assistant 的 AI-oriented RTC 框架,通过响应能力感知的自适应码率控制限制不必要的视频码率,并利用上下文感知流式传输将有限码率分配给与当前问题最相关的视频区域,同时构建 DeViBench 评估 RTC 引起的视频退化对 MLLM 准确率的影响\cite{wu2026artic}。这类工作与传统 WebRTC 优化的差异在于,其优化目标已经从“让人看得清楚和流畅”转向“让模型及时获得足够有用的视觉信息”。
总体来看,面向视频类AI的传输优化已经从视频参数自适应发展到结合内容、模型反馈和任务准确率的联合控制。然而,现有工作大多侧重应用层视频配置或端到端传输策略,对Wi-Fi信道竞争、链路层重传和队列积压等底层状态考虑不足,因而尚未充分揭示无线传输行为对视觉模型任务质量的影响。
\section{WebRTC优化研究}
WebRTC是当前低时延实时音视频通信中的重要技术框架,被广泛应用于低延迟流媒体传输、视频会议多码率优化、边缘计算通信和实时监控等场景\cite{JDCP202406008,XXWX202308018,JSJA202410013,DZQJ202504022,FJDN202504015}。与传统视频点播业务不同,WebRTC业务通常需要在严格时延约束下持续传输音视频流,因此其优化目标不仅包括提高链路利用率和视频清晰度,还包括控制排队时延、抖动、丢包恢复开销和帧级传输稳定性。围绕这些问题,现有WebRTC优化研究主要可以分为三类:一是以GCC为代表的端到端拥塞控制研究,二是面向无线动态网络的状态感知与速率控制增强研究,三是面向视频QoE的码率、分辨率、帧率和FEC等多维联合优化研究。这些研究为实时视频传输提供了重要基础,但其优化目标主要仍然面向视频传输质量和人类观看体验,尚未充分考虑实时视觉模型推理业务的特殊需求。
WebRTC优化的基础是端到端拥塞控制机制,其代表性方案为谷歌拥塞控制(Google Congestion Control, GCC)。Carlucci等人系统研究了GCC机制,指出GCC通过端到端单向时延变化、丢包反馈和带宽估计判断网络拥塞状态,并结合接收端延迟控制器和发送端丢包控制器对视频发送速率进行调节\cite{carlucci_congestion_2017}。该类方法的优点在于不依赖网络内部设备支持,具有较好的端到端部署性,因而成为WebRTC实时媒体传输中的典型拥塞控制方案。然而,GCC的核心输入仍然是端到端传输反馈。当网络状态快速变化,尤其是在Wi-Fi和蜂窝等无线网络中出现信道竞争、链路速率变化和突发排队时,仅依赖端到端时延和丢包信号容易产生状态判断滞后或误判,从而影响视频码率调整的及时性和稳定性。
针对无线网络环境中端到端反馈不足的问题,已有研究开始尝试增强WebRTC或实时视频传输系统对动态网络状态的适应能力。Carlucci等人研究了GCC在Wi-Fi网络中的表现,指出Wi-Fi信道中断结束后的分组突发到达会影响GCC延迟估计,并提出基于分组聚合的改进方法,以降低无线突发行为对拥塞判断的干扰\cite{carlucci_making_2016}。Dai等人进一步引入数据驱动方法,通过学习端到端时延、发送速率和网络状态之间的关系,提高实时视频通信在无线链路中的适应能力\cite{dai_learning-based_2018,dai_statistical_2020}。Yu等人针对移动网络中RTT和丢包反馈难以准确反映视频播放体验的问题,提出Mustang以改善高抖动场景下的实时视频控制效果\cite{Encheng}。Karimi等人提出Vidaptive,指出GCC等实时视频速率控制机制在网络快速变化时可能存在响应滞后,并通过解耦传输控制与编码器目标码率调节,提高动态网络中的链路利用率和时延表现\cite{karimi_vidaptive_2024}。此外,PBE-CC、ABC和Mortise等工作虽然并非全部专门针对WebRTC设计,但从无线跨层拥塞控制和网络感知参数优化角度说明,引入物理层测量、显式网络反馈或网络状态感知参数调优,有助于减少仅依赖端到端探测带来的控制滞后\cite{xie_pbe-cc_2020,goyal_abc_2021,Shen2026}。这些研究共同表明,无线状态感知能够改善动态网络中的实时视频传输性能,但多数方法仍主要从传输层或单向网络状态感知角度出发,尚未形成WebRTC与Wi-Fi之间的双向跨层协同。
除拥塞控制外,WebRTC优化研究还逐渐从单一发送速率控制扩展到面向用户体验质量(Quality of Experience,QoE)的多维联合优化。传统GCC主要依据端到端反馈调节目标码率,但实际视频质量还与分辨率、帧率、量化参数、FEC冗余和视频内容复杂度等因素密切相关。Li等人提出Mamba,将WebRTC中的自适应码率问题扩展为多维决策问题,通过多智能体强化学习协同调整量化参数、分辨率和帧率,以提升视频会议场景下的用户体验质量\cite{LiYueheng}。Smirnov等人面向5G网络下的WebRTC视频流,利用深度强化学习进行实时速率控制,以改善动态网络条件下的QoE\cite{Smirnov}。在丢包恢复方面,Lee等人提出R-FEC,利用强化学习联合调整视频码率和FEC冗余,在丢包恢复能力、带宽开销和视频质量之间进行权衡\cite{RFEC};Cheng等人提出ABRF,将自适应码率控制与FEC控制联合建模,根据网络状态和丢包模式动态调整码率与纠错冗余\cite{Cheng2023}。这些工作说明,WebRTC优化已经不再局限于拥塞控制本身,而是逐渐发展为码率、分辨率、帧率、冗余和视频QoE之间的多维联合控制问题。
综上所述,现有WebRTC研究提供了码率调整、发送节奏控制、FEC配置和编码参数调节等控制手段,也表明更准确的网络状态有助于改善动态网络中的实时视频传输。然而,现有方法主要依赖端到端反馈或单向网络状态感知,难以直接获得Wi-Fi内部的信道竞争、无线重传和队列积压等状态;其优化目标也主要是清晰度、流畅度、卡顿率和端到端时延,尚未充分考虑模型任务准确率、输入信息新鲜度和响应及时性。
\section{Wi-Fi实时业务优化研究}
Wi-Fi是移动终端、机器人、增强现实、边缘智能和室内实时视频传输中常见的无线接入方式。与有线网络相比,Wi-Fi链路更容易受到信道竞争、无线干扰、终端数量变化、物理层速率自适应、链路层重传和队列积压等因素影响。总体来看,相关研究主要可以分为三类:一是面向实时业务的Wi-Fi QoS保障机制,二是Wi-Fi配置、视频业务特征与应用QoE之间关系的测量分析,三是通过Wi-Fi与应用层的跨层感知进行优化设计,分为将Wi-Fi状态引入应用层和将应用层信息引入Wi-Fi两大类。
早期Wi-Fi实时业务优化主要依托IEEE802.11e中的增强型分布式信道接入机制(Enhanced Distributed Channel Access, EDCA)。EDCA通过为不同业务类型配置不同的AIFS、竞争窗口和TXOP参数,使语音、视频等实时业务能够获得高于普通数据流的信道接入优先级。然而,传统EDCA参数多为静态配置,难以适应实时视频流的码率波动、帧大小变化和无线竞争环境变化。随着Wi-Fi6/7的发展,研究者进一步从OFDMA资源分配、TXOP限制、预先信道接入以及多链路传输等角度支持实时业务。Bankov等人面向Wi-Fi7实时应用研究了限制非实时业务信道占用时间和预先信道接入等机制,以满足实时业务对时延和丢包率的严格要求\cite{bankov_tuning_2020}。Adame等人则从时间敏感网络(Time-Sensitive Networking,TSN)角度分析IEEE802.11be支持低时延高可靠业务的机制,为Wi-Fi7/8面向实时业务的标准演进提供了参考\cite{adame_tsn_2021}。这类研究说明,Wi-Fi侧已经具备通过接入优先级、空口资源分配和低时延机制保障实时业务的技术基础,但其优化粒度通常仍停留在业务类别或链路层参数层面,难以直接反映具体视频帧或模型推理任务的实时价值。
在基础QoS机制之外,相关研究进一步关注Wi-Fi底层配置、视频业务特征和应用QoE之间的关系。Kulkarni等人研究了信道宽度、接入类别、优先级队列和硬件配置等Wi-Fi参数对体积视频流应用QoE的影响,指出底层Wi-Fi配置会显著影响视频业务的稳定性和最终体验\cite{kulkarni_understanding_2023}。Casasnovas等人构建了基于Unity Render Streaming、WebRTC和Wi-Fi6的边缘/云端虚拟现实实验系统,分析WebRTC视频帧发送批次、Wi-Fi分组聚合和空口占用之间的关系,发现WebRTC视频帧的周期性批量发送会影响Wi-Fi空口效率和完整视频帧到达时延\cite{casasnovas_experimental_2024}。这类工作表明,实时视频业务的性能不仅由平均吞吐量决定,还与视频帧发送节奏、MAC层聚合方式、信道占用和完整帧到达时延密切相关。因此,Wi-Fi实时业务优化需要从单纯链路层参数配置,逐步转向结合应用层帧结构和业务体验质量的跨层分析。
近年研究进一步开始为应用层引入Wi-Fi物理层和MAC层状态,以辅助实时业务传输控制。Du等人提出Cupid,重新审视Wi-Fi网络中的拥塞控制问题,利用接收端Wi-Fi物理层测量信息感知空口占用、并发传输和物理层速率等状态,从而更准确地判断Wi-Fi瓶颈并进行速率调节\cite{du_revisiting_2024}。Yi等人提出Athena,通过从物理层到应用层的高分辨率跨层测量,分析无线网络事件对视频会议QoE的影响,并指出当前视频会议拥塞控制算法看到的往往只是网络状态的表象,缺乏对无线底层事件的可解释感知\cite{yi_athena_2024}。这些研究说明,仅在应用层被动观察端到端反馈已经难以满足低时延实时业务的稳定性需求,为应用层主动引入Wi-Fi底层状态有助于解释和改善无线环境下的视频传输性能。
除向上层提供Wi-Fi状态外,部分研究通过给Wi-Fi引入业务信息,以实现更加精准的优先级调度和拖尾时延控制。Shen等人提出LAW,引入WebRTC的尾帧信息,并通过重塑队列结构和细粒度传输机会控制降低WebRTC应用中的尾帧时延和卡顿率\cite{shen_law_2026}。Guo等人提出BLADE,面向云游戏和XR等下一代实时通信业务,通过动态调整竞争窗口来降低Wi-Fi分组尾时延和视频卡顿率\cite{guo_blade_2026}。Gong等人提出Flick,在Wi-Fi侧引入视频帧边界等信息,以进行帧感知分组调度,从而降低完整视频帧的到达时延\cite{gong_flick_2025}。这些工作共同表明,为Wi-Fi层引入应用层的帧级信息,可以实现更细粒度的调度和优先级控制,从而改善实时视频业务的传输稳定性和体验质量。
总体来看,Wi-Fi实时业务优化已经从静态QoS配置发展到无线状态感知和帧级跨层调度。现有工作证明了信道竞争、链路层重传、发送节奏和队列管理会显著影响实时业务,也说明Wi-Fi侧可以利用部分上层信息进行优先级控制和队列管理。不过,多数方法仍面向视频会议、云游戏和VR/XR等人类感知业务;已有跨层方法通常只引入局部、单向的信息,尚未同时结合WebRTC传输状态与视觉模型任务需求形成双向闭环。
\section{总结与讨论}
综上所述,四类相关研究分别为本文问题提供了不同基础。实时视觉大模型研究推动了连续视频理解、在线响应和边缘推理的发展,明确了新型智能业务对视频时效性和任务质量的需求;面向视频类AI的传输研究证明了视频内容、传输参数和模型任务质量之间存在耦合关系;WebRTC研究提供了拥塞控制、速率调节和冗余配置等端到端自适应机制;Wi-Fi实时业务研究则揭示了无线配置、发送节奏和MAC层竞争对应用体验的影响,并提供了网络侧调度与低时延保障手段。
然而,从本文研究问题出发,现有工作之间仍缺少进一步的协同。首先,已有研究一方面尝试将Wi-Fi物理层或MAC层状态提供给WebRTC及其他实时传输机制,以改善拥塞判断和速率控制;另一方面也尝试将视频帧边界、尾帧状态等应用层信息提供给Wi-Fi,以指导队列管理和资源调度。但这两类工作通常分别优化信息传递的单一方向,尚未形成WebRTC与Wi-Fi相互感知、联合决策的双向协同机制。其次,面向视频AI的研究已经提出了多种由视频内容、模型反馈和任务准确率驱动的端到端传输优化方法,但其控制对象大多集中在帧率、分辨率、区域选择和带宽分配等应用层参数,较少进一步结合WebRTC的拥塞控制、发送节奏与FEC机制以及Wi-Fi的信道竞争、链路层重传和队列调度。因而,现有研究尚未将模型任务需求、WebRTC传输控制和Wi-Fi底层状态贯通起来,形成以视觉模型任务质量为目标的跨层闭环优化框架。
针对上述不足,本文拟开展三个方面的研究:首先,基于ns-3和ns3-ai构建闭环联合仿真平台,连接真实视频客户端、WebRTC传输、Wi-Fi网络仿真和实际VLM/VLA推理服务;其次,系统分析Wi-Fi状态、WebRTC传输行为和视觉模型任务性能之间的关联,明确传统QoS与视频QoE指标在实时视觉模型业务中的适用边界;最后,设计面向视觉任务需求的WebRTC–Wi-Fi跨层协同传输方法,综合利用无线链路状态、端到端传输状态和模型任务反馈,对视频传输和无线资源进行联合调整。
上述研究将把模型任务目标、WebRTC传输控制与Wi-Fi底层状态连接起来,使无线传输优化由传统网络质量或人类观看体验进一步面向模型任务效果,并为多模态智能体、具身智能和边缘视觉推理场景下的无线网络优化提供实验与方法基础。