资讯动态

生成式AI网络层:基于提示的图像传输与网络流优化实践

发布时间:2026/8/9 10:52:43 来源:尧图企业网站定制
1. 项目概述当图像传输遇上生成式AI最近在折腾一个挺有意思的项目核心是把生成式AI的能力直接“嵌入”到网络传输层里。听起来有点抽象简单说我们不再把网络单纯看作一个搬运原始数据的管道而是让它变成一个能“理解”内容、并能根据需求“现场生成”内容的智能体。这个项目的标题叫“生成式AI网络层基于提示的图像传输与网络流优化”它瞄准的就是图像传输这个高频且吃带宽的场景。传统的图像传输无论是你刷社交媒体看高清图还是视频会议里看到对方的画面本质上都是服务器把一张完整的、编码后的图片比如JPEG、PNG通过网络包一点不差地传给你的设备。网络条件好的时候没问题但一旦遇到弱网环境——比如在电梯里、地铁上或者跨洋视频通话——卡顿、模糊、转圈圈就成了常态。我们做的就是想从根本上改变这个模式与其在弱网下拼命压缩、丢帧、降质量来保流畅不如让网络层自己“学会”用更聪明的方式传递信息。这个“生成式AI网络层”的核心思想是“传提示不传像素”。发送端不再传输完整的图像数据而是分析图像内容生成一段高度凝练的、描述性的“提示词”Prompt连同一些关键的结构或语义信息一起发送出去。接收端则内置了一个轻量级的生成式AI模型比如一个精简版的文生图扩散模型它收到提示词后结合本地的上下文实时“推理”并生成出最终的图像。这样一来网络上流动的数据量可能只有原来的几十分之一甚至百分之一对带宽和延迟的压力骤减。当然这不仅仅是压缩更是一种基于语义的、有损但“保意”的传输。它特别适合那些对绝对像素级保真度要求不高但对内容理解和实时性要求很高的场景比如远程协作白板、云游戏、AR/VR中的动态贴图、甚至智能监控视频流分析。我自己在多媒体传输和边缘计算领域泡了十多年经历过从专线到5G的各种折腾。这个项目的想法源于看到扩散模型和Stable Diffusion这类技术的爆发突然意识到生成式AI的“理解-生成”范式可能就是下一代自适应网络协议的“内核”。这不仅仅是学术上的趣味更有实实在在的工程挑战和广阔的应用前景。接下来我就把这几个月从理论验证到原型搭建的完整过程、踩过的坑以及一些还不成熟的思考详细拆解一遍。2. 核心架构与设计思路拆解2.1 为什么是“生成式AI网络层”首先要回答一个根本问题为什么要把AI特别是生成式AI放到网络层传统优化手段如WebP/AVIF编码、QUIC协议、自适应码率ABR已经非常成熟了。它们的核心逻辑是在给定的数据源像素流上做文章追求更高效的压缩编码和更稳健的传输协议。而生成式AI引入的是一种“数据源转换”的思路。我们把网络传输的对象从“数据”变成了“意图”或“指令”。在图像传输场景下这个“指令”就是提示词。它的优势是颠覆性的带宽需求断崖式下降一段描述“一只橘猫在沙发上晒太阳”的文本提示词可能只有几十个字节而一张1080p的猫图即使用上好的压缩也要几百KB。相差了四个数量级。对抗网络波动的鲁棒性极强传输几十个字节的文本即使在高丢包、高延迟的网络下也极易通过重传、前向纠错等手段保证无误到达。而传输几MB的图像任何一个关键数据包的丢失都可能导致整帧解码失败。实现真正的“语义级”自适应传统自适应码率只能在“高码率高清”和“低码率模糊”之间切换。而基于提示词的传输接收端可以根据自身算力、屏幕尺寸、用户关注点通过眼球追踪等动态调整生成图像的细节程度、风格甚至局部内容。例如在手表上生成简笔画风格的概要在平板上生成细节丰富的写实图像。当然代价也是明显的生成图像并非原始图像的精确复现是一种有损重建。因此这个架构适用的场景是那些“内容保真”优先于“像素保真”的应用。比如在线设计评审中传输一个UI界面的布局和元素关系在远程医疗会诊中传输医学影像的病灶特征区域在自动驾驶车路协同中传输前方路况的物体类别和位置关系。2.2 系统架构总览与组件职责我们的原型系统主要分为三个核心组件发送端Encoder/Prompt Extractor、网络通道AI-Aware Transport Layer、接收端Decoder/Generator。此外还有一个协调与元数据服务负责会话管理、模型同步和QoS服务质量协商。发送端 - 网络层 - 接收端 | | | (分析图像) (传输提示) (生成图像) | | | 提取提示词 语义流 扩散模型发送端提示词提取器 它的任务不是压缩而是“理解与描述”。输入是一帧图像输出是一个结构化的提示词文本可能还附带一些低维的、辅助生成的特征向量如布局草图、调色板、关键点坐标。这里我们尝试了几种方案方案A通用图像描述模型直接使用现成的图像描述Image Captioning模型如BLIP-2。优点是通用性强生成的文本人类可读。缺点是描述可能过于笼统“一张街景照片”丢失对生成任务至关重要的细节如“第三个路灯是红色的”。方案B面向生成的提示词提取我们微调了一个CLIP模型让它学习将图像映射到Stable Diffusion模型偏好的、能激发高质量生成的提示词风格。同时我们额外训练了一个轻量级网络输出一个非常紧凑的语义特征向量比如128维这个向量与提示词文本一起为接收端的生成提供更精确的引导。方案C混合编码对于某些特定场景如人脸我们甚至会结合传统编码器传输一个极低码率的“基础层”比如8x8分辨率的潜变量再配上提示词。接收端用扩散模型以这个基础层为起点进行“上采样和细化”能在极低带宽下获得比纯超分辨率好得多的效果。网络通道AI感知传输层 这是对传统TCP/UDP/QUIC协议的增强。它需要识别并优先保障“提示词数据包”的可靠、低延迟传输。因为提示词一旦出错或乱序生成的图像可能完全偏离原意。我们基于QUIC协议做了魔改实现了流优先级将提示词流标记为最高优先级确保其绝对优先调度。语义感知的FEC前向纠错对提示词文本包采用更强的冗余纠错码因为文本包小增加冗余开销相对可控但能极大提升在恶劣网络下的生存率。带内元数据在传输提示词的同时可以携带一些生成参数如期望的生成步数控制质量/速度权衡、随机种子用于多端同步生成一致画面等。接收端图像生成器 这是系统的算力消耗大户。它需要内置一个能够快速根据提示词生成图像的模型。我们不可能在终端设备上跑一个完整的Stable Diffusion XL。因此模型小型化和推理加速是关键模型选型我们选择了Stable Diffusion 1.5的轻量化变体并通过知识蒸馏和量化将其压缩到能在高端手机或边缘计算盒子上实时运行目标512x512分辨率每秒1-2帧。推理优化缓存与预热对于连续帧如视频前后帧提示词变化不大。我们缓存上一帧生成过程的中间特征如UNet的某些层输出作为下一帧生成的初始化可以大幅减少迭代步数有时只需1-3步就能得到可接受的结果这被称为“潜在一致性”或“加速采样”。条件注入除了文本提示词发送端传来的低维特征向量会通过一个适配器网络Adapter注入到UNet的交叉注意力层提供更精确的空间或风格控制。动态分辨率生成根据当前网络延迟和设备算力动态调整生成图像的分辨率和采样步数。这是一个在线优化问题我们用一个简单的强化学习模型来决策目标是平衡感知质量和端到端延迟。协调服务 这是一个常驻的轻量级服务。主要功能会话建立收发双方握手协商支持的AI模型版本、生成参数范围等。模型同步确保收发双方使用同一套“词典”模型权重。对于更新不频繁的场景可以预装对于需要频繁更新的协调服务可以推送模型差异delta。QoS反馈环接收端会向发送端和协调服务报告生成质量如通过一个轻量级的图像相似度网络计算与某个“理想参考”的差距和当前处理延迟。发送端可以根据此反馈调整提示词提取的“细致程度”例如生成更详细或更简略的提示词实现闭环优化。实操心得架构选型的权衡在早期原型中我们曾试图让发送端运行一个完整的编码器将图像编码成扩散模型的潜变量Latent。这样接收端解码生成速度最快。但后来放弃了因为潜变量虽然比像素小但仍有数KB大小且对传输错误极其敏感失去了“提示词传输”的核心带宽优势。最终我们坚持了“文本提示词极小辅助特征”的主路径这才是带宽红利最大的地方。3. 核心模块实现细节与关键技术点3.1 提示词提取从像素到语义的“翻译官”这是整个系统的“天花板”提示词的质量直接决定了生成图像的保真度。我们最终采用的是一种分层提示词提取方案。第一层全局语义描述粗粒度使用一个轻量化的BLIP模型生成一个基础的、句子级别的描述。例如“一个年轻人在公园里用笔记本电脑工作旁边有一杯咖啡。” 这确保了生成图像的基本场景和主体正确。第二层局部细节与属性细粒度这是关键。我们使用一个基于Vision Transformer (ViT) 的标签预测模型不是预测分类标签而是预测一系列“属性-值”对。这个模型是在一个精心构建的数据集上训练的数据集中每张图片都标注了对于图像生成有用的属性例如背景公园 草地 树木主体1人 年轻人 坐着 穿着蓝色衬衫主体2物体 笔记本电脑 银色 打开主体3物体 咖啡杯 白色 带有热气光照白天 阳光 阴影风格写实 照片这些属性词组合起来就形成了比第一层句子丰富得多的提示词。我们将其格式化为一串用逗号分隔的标签这就是发送的主要文本载荷。第三层结构引导特征可选微调对于需要精确空间布局的场景如UI界面、设计稿仅靠文本提示词扩散模型很难精确控制元素位置。为此我们增加了一个分支输出一个极简的空间语义图。例如将图像下采样到64x64每个像素点用一个语义类别ID表示如0背景1人物2电子设备3饮品。这个64x64的整数矩阵经过游程编码RLE压缩后体积很小通常200字节。在接收端这个语义图可以通过ControlNet或作为条件输入给UNet强约束生成图像的结构。技术实现要点模型轻量化第二层的ViT模型我们使用MobileViT或EfficientNet结构并在提取特征后接一个多标签分类头。模型大小控制在10MB以内。词汇表约束属性预测的词汇表是预先定义好的大约2000个词这保证了输出提示词的规范性和可解析性也避免了生成生僻词导致接收端模型不理解。延迟与精度平衡提取过程必须在几十毫秒内完成。我们采用多线程流水线第一层描述生成与第二层属性预测并行执行第三层结构特征则根据应用需求按需启用。3.2 网络流优化为“提示”保驾护航传统的视频流优化如WebRTC关注的是码率、帧率、丢包恢复。我们的AI流优化关注的是“语义单元的完整性与及时性”。1. 提示词分片与编号 一个复杂的提示词可能较长。我们将其分片成多个网络包传输。每个包都有唯一的、递增的序列号并属于同一个“生成帧ID”。接收端必须按序收齐所有分片才能组装出完整的提示词。这里我们借鉴了HTTP/2的流Stream概念为每一帧的提示词数据建立一个独立的流。2. 基于重要性的差异化保护 我们分析发现提示词中的不同部分对生成结果的影响权重不同。例如“一个男人”比“穿着红色格子衬衫”对主体识别的影响更大“在跑步”比“在公园里”对动作的影响更大。虽然目前还做不到精确的词汇级权重分配但我们做了一个简单的分层关键层主谓宾核心句由第一层提取。这个层的数据包采用最强的FEC保护和最快的重传机制。细节层属性列表由第二层提取。可以采用稍弱的保护。增强层结构特征或其他辅助数据第三层。可以容忍一定的丢失丢失后接收端仅依赖文本提示词生成。3. 前向纠错FEC策略 我们对文本提示词包采用了喷泉码Fountain Code的一种简化应用。原理是发送端源源不断地发送编码包每个包都是原始数据包的随机线性组合。接收端只要收到足够数量略多于原始包数的任意编码包就能以高概率解码出所有原始数据。这对于高丢包、长延迟的链路特别有效避免了停等重传的延迟。虽然计算开销稍大但我们的数据量小文本完全可接受。4. 拥塞控制适配 我们修改了QUIC的Cubic拥塞控制算法加入“语义紧迫度”因子。当系统处于连续生成模式如视频时如果检测到网络拥塞不是一味降低所有流的发送速率而是优先保障最新帧的提示词流可以适当丢弃或降低旧帧的增强层数据发送。因为用户通常对最新画面的及时性更敏感。3.3 接收端生成在边缘快速“作画”接收端的核心挑战是在资源受限的设备上快速、高质量地根据提示词生成图像。我们围绕Latent Consistency Models (LCM)和模型量化展开了大量工作。模型选型与加速LCM的应用传统的Stable Diffusion需要50-100步的迭代去噪才能得到高质量图像实时性无从谈起。我们采用了潜在一致性模型LCM的蒸馏技术。LCM的核心思想是通过知识蒸馏训练一个模型使其能在极少的步数甚至1-4步内直接从噪声潜变量预测出最终干净的潜变量。我们使用SD 1.5的基础模型在特定数据集上进行了LCM蒸馏得到了一个仅需2-4步就能生成不错结果的“极速版”模型。推理流水线优化提示词编码缓存文本提示词需要通过CLIP Text Encoder转换成文本嵌入Text Embeddings。这个过程相对耗时。我们发现在连续帧中提示词的变化往往是渐进式的。因此我们缓存上一帧的文本嵌入当新提示词到来时只计算变化部分通过词元对比的嵌入其余部分复用缓存大幅减少了编码时间。潜变量预热这是针对视频流的关键优化。我们不是对每一帧都从纯随机噪声开始生成。而是将上一帧生成得到的最终潜变量经过一个轻量的运动预测网络一个简单的卷积网络预测出当前帧潜变量的初始估计。然后以这个预测值为起点进行LCM的少量步数采样。这相当于给了扩散模型一个很好的“初值”使其更快收敛到符合新提示词的目标图像同时保持了帧间连续性减少了闪烁。动态计算图与算子融合使用ONNX Runtime或TensorRT等推理引擎将整个UNet模型编译成一个高度优化的计算图。特别是将注意力Attention层中的多个小算子进行融合减少内核启动开销这对移动端GPU尤为重要。质量评估与自适应 接收端生成图像后如何知道生成得好不好我们部署了一个轻量的图像质量评估IQA网络它输入生成图像和接收到的提示词文本输出一个“语义对齐分数”。这个网络也是提前训练好的学习判断生成的图像是否匹配提示词的描述。如果分数低于阈值接收端会通过协调服务向发送端发送一个“NACK”否定确认附带分数低的原因如“主体缺失”、“属性不符”。发送端收到后可能会在下一帧尝试提取更详细或更准确的提示词。4. 原型搭建与全链路实操记录4.1 开发环境与工具链选型我们选择Python作为主要开发语言因其在AI原型开发上生态最完善。关键库包括深度学习框架PyTorch (用于模型训练、微调和原型验证)。最终部署时转换为ONNX或使用TensorRT。扩散模型库Diffusers (Hugging Face)。它提供了Stable Diffusion和各种采样器、LCM蒸馏流程的完整实现极大降低了开发门槛。网络编程aioquic(Python的QUIC库)。用于构建我们魔改的AI感知传输层。选择QUIC是因为它基于UDP避免了TCP队头阻塞且原生支持多流和加密我们可以在其框架上增加自己的逻辑。前端演示一个简单的Flask Web应用用于展示发送端上传图片、接收端实时生成的效果对比。前端用JavaScript配合WebSocket用于传输控制信令和HTTP/2用于传输提示词数据流来模拟。硬件上发送端使用一台普通PC带GPU接收端我们分别测试了另一台PC、一台MacBook ProM2芯片和一部高端安卓手机骁龙8 Gen2以覆盖不同算力场景。4.2 端到端数据传输流程实操假设我们要从客户端A传输一张图片到客户端B。步骤1会话建立A向协调服务器发起连接请求携带自身支持的AI模型版本号如“sd1.5-lcm-v2”。协调服务器检查B的注册信息如果B支持相同或兼容的模型则回复A一个会话ID和B的地址/端口。同时通知B即将有来自A的会话。A与B之间建立一条直接的P2P QUIC连接如果NAT穿透失败则通过协调服务器中继。步骤2首帧传输与生成A捕获或加载一张图片。提示词提取流水线启动图片被同时送入BLIP模型和自定义的ViT属性预测模型。BLIP生成全局描述句子S。ViT模型输出属性列表L。可选如果需要结构提取网络输出语义图M。将S和L拼接成最终提示词文本T。例如“一个年轻人在公园里用笔记本电脑工作旁边有一杯咖啡。年轻人 蓝色衬衫 坐着 银色笔记本电脑 打开 白色咖啡杯 热气 草地 树木 阳光 写实风格”。网络层封装与发送A的网络模块将提示词文本T分片并为每个分片添加头部信息[会话ID 帧序号 分片号 重要性标记]。对T的分片应用FEC编码生成冗余包。将T的分片包、FEC冗余包以及可选的M的编码包通过QUIC流发送给B。关键点T的包标记为最高优先级流。接收端B的处理B的网络模块按序接收并组装提示词T。如果T有缺失则使用FEC包尝试恢复或请求重传。B的AI生成模块收到完整T后启动生成流水线 a.文本编码将T输入CLIP文本编码器得到文本嵌入。 b.初始化潜变量如果是首帧从随机噪声初始化如果是后续帧使用上一帧的潜变量经运动预测网络预热。 c.LCM采样将文本嵌入和初始潜变量输入LCM-LoRA UNet进行2-4步的采样去噪。 d.VAE解码将去噪后的潜变量输入VAE解码器得到像素空间的图像。 e.质量评估轻量IQA网络评估生成图像与T的匹配度。如果合格则显示图像如果不合格记录日志并可能触发反馈。步骤3连续帧视频流自适应在视频模式下A会以一定帧率如10fps捕获画面并重复步骤2。但会增加以下优化差分提示词A会计算当前帧提示词T_t与上一帧提示词T_{t-1}的差异。如果差异很小例如只改变了几个属性词则只发送差异部分deltaB端将其与缓存的T_{t-1}合并得到T_t。B端反馈B会持续监控生成延迟和IQA分数。如果生成延迟持续高于阈值如200msB会通过协调服务向A发送指令要求A降低提示词提取的“细节度”例如让ViT模型预测更少的属性或者A主动降低发送帧率。反之如果B端算力充裕且网络良好可以请求更详细的提示词以提升质量。4.3 关键参数配置与调优经验这个系统有很多“旋钮”可以调节需要在带宽、延迟、质量之间做权衡。参数发送端控制接收端控制影响与调优建议提示词细节度ViT模型预测的属性数量上限。通过反馈请求调整。高生成质量好带宽稍增文本。低生成可能模糊或缺失细节带宽降低。调优初始设为中等根据接收端反馈动态调整。结构特征开关是否启用并发送64x64语义图。通过能力协商决定。开极大改善空间布局准确性额外增加~200字节/帧。关依赖文本提示词布局可能随机。调优对UI、设计图等强结构场景开启。LCM采样步数不直接控制但影响生成质量预期。根据设备算力和延迟要求动态设置。步数多如4步质量高延迟大。步数少如1-2步质量可能下降延迟小。调优在高端设备上可用4步移动端用2步并通过潜变量预热补偿质量损失。FEC冗余度网络层根据当前丢包率估计动态调整。不直接控制。冗余度高抗丢包强带宽开销大。冗余度低带宽省但丢包可能导致提示词不完整。调优初始设为20%根据历史丢包率动态调整如丢包率5%冗余度设25%。生成分辨率不直接控制。根据设备屏幕和算力选择。高分辨率如512x512观感好计算慢。低分辨率如256x256计算快可能模糊。调优可先以低分辨率快速生成再使用超分模型上采样体验更流畅。踩坑实录提示词一致性问题我们最初直接用BLIP的输出来做提示词发现一个严重问题同一张图片BLIP可能会生成略有不同的描述如“一个男人在打电话” vs “一个人拿着手机”。这导致发送端和接收端对于“同一帧”的理解在语义上存在细微漂移在视频流中会引起闪烁。解决方案我们固定了BLIP的生成参数如beam search大小、温度并引入了一个“提示词规范化”步骤将同义词映射到标准词如“手机”-“电话”确保了描述的一致性。5. 性能评估、问题排查与未来展望5.1 实测性能数据与对比分析我们在一个模拟的弱网环境下带宽1Mbps RTT100ms 随机丢包率2%进行了测试对比传统JPEG传输和我们的AI流传输。测试场景传输一段15秒、10fps、分辨率512x512的桌面操作演示视频包含窗口移动、文字输入等。指标传统JPEG (H.264 低码率)AI流传输 (本项目)说明平均带宽占用~800 Kbps~15 KbpsAI流优势巨大主要是提示词文本数据量极小。端到端延迟450-1200 ms180-350 msAI流延迟更稳定。JPEG延迟波动大受I帧和重传影响。主观视觉质量块状模糊 文字难以辨认画面清晰 文字可读但非像素级还原AI流生成的图像在语义上是正确的观感更舒适。抗丢包能力差 丢包导致花屏、卡顿极强 2%丢包下无明显感知提示词包的FEC保护使其几乎不受影响。接收端CPU/GPU占用低仅解码高持续AI推理这是AI流的主要代价算力需求从云端转移到了边缘。分析结论在带宽极端受限或网络不稳定的环境下AI流传输在体验流畅度和语义信息保真度上具有压倒性优势。其代价是接收端需要具备一定的AI推理算力并且生成图像并非原始图像的精确复制。5.2 典型问题排查手册在实际部署和测试中我们遇到了各种各样的问题。下面是一个快速排查指南问题现象可能原因排查步骤与解决方案接收端生成图像完全错误如牛头不对马嘴1. 提示词传输错误。2. 收发双方模型版本不一致。3. 随机种子差异过大。1.检查网络日志确认提示词包是否完整接收校验和是否正确。2.验证模型哈希通过协调服务比对双方模型文件的MD5。3.固定随机种子在会话建立时由协调服务器同步一个初始种子。生成图像质量低下模糊、扭曲1. LCM采样步数太少。2. 提示词过于简略。3. 潜变量预热错误。1.增加采样步数从2步尝试增加到4步。2.增加提示词细节让发送端提取更多属性。3.关闭预热检查运动预测网络是否引入噪声暂时禁用预热从纯噪声开始生成。视频流闪烁严重1. 提示词前后帧差异过大。2. 随机种子每帧变化。3. 潜变量预热不收敛。1.启用差分提示词只传输变化部分保持主体描述稳定。2.序列化随机种子每帧使用基于帧序号衍生的种子确保可重现性。3.调整预热权重降低运动预测网络对初始潜变量的影响权重增加噪声成分。端到端延迟过高1. 接收端生成速度慢。2. 网络RTT过高。3. 提示词提取耗时过长。1. ** profiling生成流水线**用工具分析UNet、CLIP、VAE各阶段耗时针对性优化如量化、图优化。2.检查网络路径是否走了中继尝试优化P2P连接。3.简化提示词模型考虑使用更轻量的图像编码器替换ViT。带宽占用高于预期1. 结构特征等辅助数据过大。2. FEC冗余度过高。3. 差分提示词失效始终传全量。1.压缩辅助数据对语义图使用更高效的编码如熵编码。2.动态调整FEC根据实时丢包率下调冗余度。3.检查差分算法确保帧间差异检测的阈值设置合理。5.3 局限性与未来演进方向目前的原型证明了概念的可行性但要走向实用化还有很长的路要走。主要局限性领域泛化能力我们的提示词提取模型在训练数据覆盖的领域如自然场景、人物表现良好但对于高度专业、细节丰富的图像如电路板、医学显微图像提取的提示词无法引导生成模型还原关键细节。这需要领域特定的训练数据。计算开销尽管有LCM在终端设备上持续运行扩散模型依然耗电严重会导致设备发热。这对移动设备是一个挑战。非因果性失真对于需要绝对像素精确的应用如文件传输、二维码识别这种方法不适用。它本质是一种有损的、感知优先的编码。初始延迟虽然连续帧延迟低但建立会话、加载模型的初始延迟可能达到数秒。未来可能的演进方向专用化小型生成模型为特定垂直场景如视频会议的人像训练超轻量化的专用生成模型在质量和速度上取得更好平衡。混合编码体系与传统的视频编码标准如VVC结合。将AI流作为“语义基础层”传统编码作为“细节增强层”。在网络好时传输增强层实现像素级还原网络差时仅靠基础层保证语义连贯。标准化与协议化需要定义一套标准的“AI媒体流”协议包括提示词语义格式、模型接口、QoS反馈机制等以便不同厂商的设备能够互联互通。云端协同推理在终端算力不足时可以将部分生成步骤如高分辨率重绘卸载到边缘云或云端形成端-边-云协同的推理流水线。这个项目更像是一把打开新世界大门的钥匙。它告诉我们当网络层开始理解它传输的内容时很多固有的瓶颈可以被巧妙地绕过。虽然目前还有很多工程和算法上的挑战但“基于生成的通信”这个范式或许会在未来的6G、元宇宙、具身智能等对实时性、交互性要求极高的场景中找到它不可替代的位置。至少在下次视频会议卡成PPT时我可能会想如果传的是“一个人在说话”而不是一堆宏块会不会就没那么难受了。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价