
1. 展台初见InterDigital在MWC26现场到底“秀”了什么巴塞罗那会展中心的展馆一直是这样的调性——越大的展台屏幕越亮声音越大。但这次我特意绕开那几个堆满跑车和巨幕的企业馆直接去了位于2号馆侧的InterDigital展区。原因很简单这家在通信和视频编码领域耕耘了几十年的技术公司每次出手都踩在标准演进的节点上而MWC26正好是6G愿景开始落地的关键一届。现场比我想象中要安静不少。没有花哨的舞台表演没有扫码送礼的兼职模特展台上就是几块触控屏、两副AR眼镜、一台用透明外壳裸露内部结构的信号处理设备以及一群挂着公司工牌、随时准备跟工程师聊技术细节的讲解员。我挤进人堆里听了三轮讲解又自己上手试了试几套演示系统整体印象是InterDigital这次主打的不是单点黑科技而是一条完整的“从无线接入到终端体验”的成果链。先说我能明确看到的四大板块。第一块是面向6G的无线AI平台核心是一套能实时感知频谱环境、自动调整无线参数的在线学习系统第二块是沉浸式视频传输方案重点在点云压缩和移动端VR/AR画质优化第三块是端侧AI加速引擎专门解决手机、机器人这些资源受限设备上的模型推理问题第四块则是一系列标准化布局包括对VVC、点云压缩等关键技术的专利贡献展示。每个板块都有可操作的原型机和实测数据不是PPT画饼。这套打法其实符合InterDigital一贯的定位——不做终端、不卖基站而是把最底层的算法和专利做深做透再通过标准授权和合作研发渗透到产业链的每一个环节。对来逛展的普通观众来说它没有消费级产品那么“好看”但对搞通信、视频、AI落地的从业者而言这里的信息量反而比不少明星展台更密集。我花了整整一个下午在这里整理了十几个问题跟现场工程师聊了不少细节。这篇文章就把其中最核心的技术思路、演示细节和一些同行最关心的落地经验写下来。2. 六G无线AI从“网络自动配置”到“频谱态势感知”2.1 为什么6G一上来就要拥抱AI我过去写过几次MWC展后的技术总结但凡提到面向未来的无线网络绕不开的共识是6G绝不会只是5G的带宽倍增它的核心特征是“内生智能”。为什么要内生因为6G要服务的场景太杂了——低轨卫星通信、工业超低时延专网、无源物联网、车路协同、通感一体每一个场景对时延、可靠性、功耗的要求都不一样甚至互相冲突。如果是人工配置参数一个切片一个策略去调网络运维团队根本干不过来。InterDigital现场演示的那套无线AI系统解决的就是这个矛盾。系统架构并不复杂边缘侧部署了若干台软件无线电设备模拟真实基站和终端的收发行为旁边一台服务器上跑着在线训练框架。它的核心链路就是“信号特征采集—环境状态实时建模—决策策略输出”这三步全程没有人工参与。现场工程师给我演示了一个极端场景在没有任何外部告警的情况下系统通过监测时频资源上的干扰模式变化自己判断出本地出现了新的强干扰源随即把工作频率和波束成型权重都做了调整整个过程大概不到两秒。这里有一个值得所有做通信AI的人关注的细节这套系统不是简单地把训练好的模型拿过来做推理而是持续在线学习。基站每接收一批新数据模型会实时更新一小步从而适应环境变化。用工程师的话来说他们做的是“让网络自己学会在变化的无线环境里生存”而不是“让网络执行一个预先编好的谱”。2.2 现场演示背后的三级技术台阶如果只是想了解“6G网络能用AI做什么”上面的概念已经足够。但从技术落地角度我更关心它具体做到了哪一层。InterDigital这十几分钟的演示其实是把三级递进的技术能力浓缩在了一起。第一级是频谱感知。无线系统在不修改协议的前提下利用接收机已有的基带数据、信噪比估计和时频占用信息训练出一个环境分类器。它不需要额外加硬件纯粹是软件升级这套思路在现有5G网络上就可以先跑起来。第二级是预测性调度。常规的调度器是被动的收到请求才分配资源而InterDigital演示的调度器会结合历史数据预测未来几百毫秒的业务需求提前把资源做好预留从而降低时延和抖动。第三级是波束与功率的联合自优化这属于所有分级里最难的一步因为它直接改变物理层参数必须保证控制回路收敛不能出现参数来回震荡的情况。展台上其实摆着一台实时频谱仪屏幕上的频谱瀑布图会跟系统的调度策略联动。当干扰源出现能看到对应频段的颜色瞬间发生变化紧接着系统自动跳频这种眼见为实的演示比任何流程图都更有说服力。2.3 这项技术在真实场景里怎么用跟现场工程师交流后我认为这套无线AI最现实的落地场景首先是工业专网。工厂里面的无线环境非常复杂AGV小车穿梭、金属机架反射、电焊设备产生的干扰时刻在变化靠人工调优根本跟不上。有了在线频谱感知和自动决策能力专网可以让网络自己保持最优状态省去大量运维成本。另一个被提到的高价值场景是低空通信。无人机集群和低空物流对无线链路非常敏感一旦出现遮挡或干扰传统切换机制很容易造成链路中断。但如果网络基站在干扰发生前就能通过频谱态势变化预测到风险提前切换波束或加强冗余编码通信连续性会有本质提升。这套方案的运行逻辑跟自动驾驶很像核心就是“提前半秒替用户做决策”。这里有个参数值得记一下现场演示的时延预算。从信号采集到策略生效端到端控制在两秒以内其中很大一部分时间是留给“判断是否真发生了环境变化”的确认窗口避免误切换。实际做类似系统时这个确认窗口的时长往往是个需要反复调的点太短容易抖动太长又会错过最佳干预时机。3. 沉浸式视频传输点云压缩和VVC其实是同一个目标的两条路线3.1 8K、VR、AR把传输带宽逼到了什么程度逛到沉浸式视频区域时工作人员先给我看了一个数据对比一份3分钟左右的8K VR全景视频如果用未压缩的RGB格式存储数据量接近300GB即便用目前主流的HEVC标准做压缩码率也要到80Mbps左右才能保证转头时有足够的清晰度。对于5G网络来说这个码率勉强可以推但对移动网络来说并不友好更不用说给普通家庭宽带了。到了6G时代沉浸式视频的目标码率压缩指标几乎没有余地——业界普遍希望在保证视觉质量的前提下把同等分辨率的码率再压低一半以上。这就是InterDigital把重点押在沉浸式视频压缩上的原因。他们在现场展出的不是一台播放器而是一套完整的“采集—压缩—传输—渲染”流水线视频源来自一台多摄像头阵列实时拼接出来的点云数据经过编码后传输到旁边的AR眼镜端进行渲染。3.2 点云压缩方案里最核心的设计选择点云是什么你可以把它理解成三维空间里的粒子集合每个粒子都有XYZ坐标和颜色信息。一台高精度激光扫描仪产生的点云每秒就有几百万个点数据量比普通视频还要大得多。为了传输这种数据业界已经有V-PCC和G-PCC两个思路但实际效果还是得看各家的工程实现。InterDigital演示的方案的亮点在于它的分块编码策略。它先把点云按空间划分成多个局部块然后对每个块单独选择合适的几何压缩模式。有些块很平坦比如地板、桌面就用低阶预测有些块结构很复杂比如人的头发、植物的树叶就切到高精度模式。这种方案跟编解码里面的“内容自适应”是一模一样的逻辑但具体实现起来涉及大量块边界处理、几何和纹理属性的联合编码等问题工程难度不小。传输端还有一个直观优化他们把“当前用户正在注视的视口”作为高码率区域其余区域降为低码率做背景填充。这个技巧在VR直播里已经不新鲜但InterDigital把它跟分块点云编码结合在一起视口内的数据块全部高保真编码视口外则用大幅度降采样替代整体码率节省相当可观。3.3 VVC在移动终端上的落地进度除了点云InterDigital在二维视频编码上的积累也一样拿得出手。展台上放着一排手机、平板和笔记本跑的是同一个演示序列——一段包含大量复杂纹理和高频运动的短片分别用HEVC和VVC两种编码器压到相同码率然后并排显示画面。肉眼观察下VVC在树叶抖动和字幕边缘这些区域的画质优势非常明显几乎没有HEVC那种常见的块效应。工作人员告诉我他们现在主要在做的事情之一是让VVC编码能在移动端实时跑起来。VVC压缩率高但复杂度也比HEVC高了好几倍早期芯片根本扛不住实时编码。现场跑通的那套方案是利用GPU的并行能力把编码任务切到几百个线程同时处理配合针对移动端ARM架构优化的汇编指令集最终在旗舰级平台上实现1080P/60帧的实时编码功耗控制在一瓦以内。这个数字在移动端非常有吸引力意味着未来手机可能直接用VVC直播而不需要依赖云端转码。4. 端侧AI与人机交互把AI推理做“轻”是一门手艺4.1 展台上的AR交互演示到底展示了什么沿着展台往里走我发现最热闹的位置是一副AR眼镜的体验区。戴上眼镜你可以看到前面桌面上悬浮着一个虚拟的机械臂模型用手去做抓取动作机械臂会跟着你的手指运动一侧的屏幕上实时显示着整个手部关键点的识别状态和推理耗时。这套体验的关键词是“端侧”。按常理来说手部关键点识别这种任务交给云端大模型去算非常容易但要在一个时延敏感、电池有限的AR设备上实时跑起来对模型大小、算力占用和帧率都有硬约束。InterDigital的思路是自研一个轻量化的手部姿态估计网络骨架主干部分用神经架构搜索NAS自动生成模型参数量控制在几兆级别配合浮点改定点的量化压缩最终在AR眼镜这颗算力不到手机三分之一的处理器上也能跑到30FPS以上。我特意问了一下工作人员为什么非要端侧跑而不是直接走5G远程渲染回答案很直接时延和隐私。远程渲染一到两百毫秒的往返时延会明显破坏AR交互的“跟手感”而手部动作这种极其私密的传感器数据很多用户也不希望传到云端处理。端侧推理不是最炫酷的方案但它是目前技术路线里最现实、最容易被用户接受的一种。4.2 模型瘦身和精度保持的取舍方法我在现场跟工程师聊到了他们训练这套手部姿态模型的细节其中很多经验和常规深度学习项目是通用的。整套流程大致分为三步先从头训练一个大模型在校验集上刷分再用蒸馏方法让一个小模型去模仿大模型的输出行为最后对模型做8bit量化并针对目标芯片做算子融合和缓存优化。这里最容易被忽略的是第二步——知识蒸馏的作用。很多团队上来就直接用小网络训练结果精度一直上不去。但实际上用大模型当老师把大模型在各类姿态上的输出“软标签”作为监督信息小模型在中高难度手势上的准确率能提升好几个百分点。我在现场看的演示里有一组数据对比同样结构的小模型纯监督训练和蒸馏训练在手部遮挡场景下的关键点平均误差差了近30%这个差距已经足够影响交互体验了。当然量化也不是随便压位就能做的。工程师说他们用了一个逐步量化策略先量化权重保留激活值浮点跑一轮重新校准收集分布再尝试量化激活值但根据每个层的敏感度决定是否跳过量化。部分层会保留浮点部分层用8bit混合精度方案比全量化方案能多找回一两个点精度代价只是内存带宽稍有增加在终端设备上是完全值得的。4.3 这条路线对消费端产品的启发参观完这套端侧AI演示我最大的感受是未来一年可能会迎来一批端侧交互产品的大爆发。除了AR眼镜人形机器人和服务机器人也在往端侧智能方向发展。移动机器人一旦离开固定场地通信链路不可能每次都回传服务器做决策必须在本地完成物体识别、避障和姿态估计这跟AR眼镜的需求本质上是一样的。InterDigital这类公司手里握着的专利组合恰恰覆盖了模型压缩、传感器数据处理、低功耗调度这些并肩的关键环节。我自己做过一段移动端AI开发深知这里面的路并不好走芯片平台的算子库是否齐全、内存带宽能不能跟上、散热功耗有没有余量每一项都会卡住项目的进度。所以如果一个团队想在消费级设备上做端侧智能建议从源头就定好目标芯片平台围绕它的量化工具链和算子支持设计方案不要先做模型再去找硬件适配那是典型的从需求往实现方向做反了。5. 从这次MWC26演示里我拆到的可复用经验5.1 衡量创新成果的“三个硬指标”在逛展过程中我一直在脑海里给每个演示项目做“打分表”。回头总结起来这套评分标准其实可以拆成三个硬指标分别对应商业价值、工程完成度和技术护城河。第一是压缩率或效率增益。做通信和视频的成果最终都要回归到“能不能用更少的资源干掉同样的事”这四个字上现场展示的方案比如点云压缩和VVC移动端实时编码核心指标都写得很清楚码率比上一代标准降低百分之多少功耗压到多少毫瓦。第二是端到端时延。尤其在做无线AI和AR交互的项目时时延是直接决定可用性的指标算法再花哨如果整条链路多绕了300毫秒用户一定会甩掉设备。第三是硬件友好度。也就是方案能否在普通商用芯片上运行而不是依赖特种设备这一点往往被很多实验室项目忽略却是规模化落地的关键。用这套标准去看InterDigital的展台会发现它几乎所有演示都符合这个逻辑。无线AI在通用处理器上跑、VVC编码在消费级手机芯片上实现、点云方案对接的也是普通商用级AR眼镜这说明他们内部做成果评估的时候已经在刻意用“能不能在真正量产的设备上跑”来约束研究方向了。5.2 现场演示里那些看不见的取舍说句实话逛这种大厂的展台不能只看演示成功时有多流畅更要观察演示方案背后的取舍逻辑。第一个细节是它没有展示多用户的场景所有交互都是单机版。这一点可以理解毕竟在展台环境里搭建多用户通信和同步的复杂度很高单机演示可以把变量控制到最小突出核心能力。但作为同行我心里清楚多用户并发时的干扰处理和资源分配才是真正检验方案的时刻这是实际部署时必须补的一课。第二个细节是点云演示的视点变化。他们展示的视口切换是平滑渐变式的没有做过快的瞬移这对带宽评估是非常友好的设定。真正常见的VR体验恰恰是快速转身、上下探头这种大幅度视角突变码率波动会比演示场景剧烈得多。这不是说InterDigital技术上做不到而是说明公开演示往往倾向于展示性能最稳定的区间。第三是现场没有公布标准的对比细节。比如VVC和HEVC对比时是用什么码率、什么编码预设、什么质量指标同样是VVC也有slow和fast模式之分slow模式画质更好但编码速度慢fast模式速度在线但压缩率打折。所以在评估一份演示数据时一定要追问它的对照环境是否公平这个习惯在哪都适用。5.3 想在这个赛道跟进的人我建议你在哪里下手如果你看完这篇文章也想冲着通信视频或者端侧AI这个方向做点自己的东西结合这次InterDigital展示的技术路线我给出几个可以直接落地的建议。先从硬件和数据集入手。无线AI方向可以找两套软件无线电设备一台当基站一台当终端然后把频段上所有干扰信号录制下来做一个属于自己的“频谱环境变化数据集”。不用追求多豪华的设备能用脚本控制信号源发生器的状态就有得玩了。视频这块也一样找一段公开授权的点云序列或8K视频源用VTM参考软件跑一遍记录下不同预设下的码率和PSNR/SSIM数值建立自己的baseline。然后再做集成层面的创新。单干编码算法很难突破参考软件但如果你把点云分块策略跟视口自适应结合起来大概率能做出一套有意思的方案如果你熟悉某款手机芯片的NPU调度API就值得把量化和蒸馏流程挂在上面做个离线工具链——这些方向都踩在本次展台展示的能力交叉点上也就是InterDigital这几年真正在深挖的位置。最后别忽略专利调研。做这个领域的研究至少要翻一下VVC和V-PCC的标准提案库搞清楚哪些方案已经被申请了专利保护。做技术方案的很多工程师都不喜欢看专利但在这种标准驱动的领域专利检索做得好可以帮你避开大量后期商业化的坑。这里给一个我自己的习惯每周固定花一小时去查新公开的标准提案不是为了照抄而是为了知道“这个方向已经有人做过什么”省得重复造轮子。6. 一些值得带回个人项目里的思考逛完InterDigital的展台、跟工程师聊完之后我在回酒店的公交上翻自己的笔记越看越觉得“通信AI视频”这三条线的交叠接下来会是产业链最拥挤的地方。过去展商给你看的是某个芯片多快、某个终端多薄现在看的是智能体如何互相协作、核心算法如何驱动体验升级。从现场的人气和咨询量判断这次InterDigital的几个演示区域内几乎全程有人追问大家关心的已经不再只是“专利技术”而是“下一代网络和终端里我的产品能怎么用上这些能力”。我自己印象最深的还是端侧AI那套手部交互方案。它教会我的一件事是在资源受限的设备上做好一个功能比在云端堆算力做出一个效果要难得多也因此更有技术含量。现场他们能把一个实时推理模型压缩到几兆字节并保持稳定帧率这套工程流本身就有很强的复用价值。做类似产品时我建议你先把手上的模型结构简化再把数据蒸馏做扎实最后才考虑量化部署顺序不要颠倒。最后分享一个观展小技巧逛MWC这种大展会时与其盯着大展台看产品Demo不如多花点时间跟那些技术型公司的工程师面对面聊。展台屏幕上的参数和展板的宣传语很容易注水但工程师现场给出的解释和回答往往能让你快速判断这项成果的真实成熟度。InterDigital这次给每台演示设备旁边都配了真人工程师全程没放什么宣传片但这种把事情讲透的展示方式才是对专业观众最大的尊重。8. 扫码登记信息时顺便要了一份技术白皮书回来后我会按里面给的测试序列和工具配置再复跑一轮数据把现场看到的指标变成自己能复核对的数据这才算没有白跑一趟MWC。