C COMPIN BLOG

COMPIN TECHNICAL NOTE

AtomBeam 技术全景:从码本编码到性能指标验证

从一条短消息讲清 AtomBeam 的码本、Huffman 与差分编码,再说明 75% 数据缩减、4× 有效带宽和 Link 16 场景应当怎样验证。

AtomBeam 面向一个很具体的工程问题:几十字节的机器消息往往带有稳定重复结构,而传统压缩器在单条短消息上很难摊薄建模和格式成本。

它给出的公开方案可以概括为:

先从代表性数据中学习常见模式,为这些模式建立共享码本;运行时用短码字替换长模式,并为新模式准备原文、二级编码和差分编码等无损路径。

这套思路具有清晰的技术价值。它把复杂计算放在训练阶段,把在线路径收敛为切块、查表和少量差异处理,适合长期运行、结构稳定的遥测与状态数据。

本文先讲原理,再讲系统与专利,随后用实验结果评估指标,最后给出结论:

  1. 先看一条消息怎样编码;
  2. 再看编码器怎样扩展为可部署系统;
  3. 接着按系统层次梳理公开专利;
  4. 然后回到我们的独立实验;
  5. 最后说明各项性能指标怎样获得完整证据。

本文依据 AtomBeam 官方资料、公开专利和 COMPIN 可复现实验撰写。我们的实现定位为公开机制的独立验证,与 Neurpac 私有产品保持清晰区分;自定义协议和 SISO/DIS 仿真包络也分别标注来源与用途。

一、先看原理:一条短消息怎样编码

1. 短消息中的重复从哪里来

假设设备每秒发送一条 40-byte 状态消息。连续观察大量记录,通常会看到:

  • 设备类型长期稳定;
  • 正常状态和保留位频繁重复;
  • 温度、位置或计数器缓慢变化;
  • 少数字节承担高变化信息。

整条消息未必完全相同,但局部模式会反复出现。AtomBeam 的关键做法,是把跨消息重复转化为可共享的短码。

训练阶段
历史消息 → 切分 → 统计模式 → 生成码本
                                │
                    ┌───────────┴───────────┐
                    ↓                       ↓
                 发送端                   接收端

运行阶段
当前消息 → 切分 → 查码本 → 发送短码 → 查表恢复

2. 把消息切成源词

编码器先把记录切成固定长度的源词(source word/sourceblock)。例如把 40 byte 分成 8 个 5-byte 源词:

40-byte record
┌─────5 B─────┬─────5 B─────┬─────5 B─────┬ ... ┬─────5 B─────┐
│   源词 1    │   源词 2    │   源词 3    │     │   源词 8    │
└─────────────┴─────────────┴─────────────┴─────┴─────────────┘

块长决定命中率、码本规模和单次替换收益:

源词长度主要优势主要成本
较短重复概率较高,覆盖容易一条记录需要更多码字
较长命中一次可替换更多比特样本更稀疏,码本规模上升
多种长度更适应混合数据区段选择、边界和同步更复杂

因此,块长适合通过训练和验证数据共同选择。

3. 用码本建立长词与短码的映射

码本(codebook)保存源词与码字(codeword)的对应关系。下面是一张教学用码表:

源词训练频率码字
常见状态 A很高0
常见状态 B较高10
偶发状态 C较低110
未命中标记 MIS—111

当原源词为 40 bit,而码字只有 1~3 bit 时,精确命中可以产生显著缩减。

码本同时也是双方共享的协议状态。生产系统会为它配置标识、版本、指纹、发布时间和回滚策略,确保两端始终使用一致映射。

4. Huffman 负责按频率安排码长

Huffman 编码遵循一个直观原则:

高频符号使用较短的码,低频符号使用较长的码,并保持前缀可解码。

它负责频率到码长的转换。协议语义、字段含义和块长选择由训练系统在更上层处理。

COMPIN 实验采用规范 Huffman(canonical Huffman)。保存符号及码长后,编码端和解码端可以确定性地恢复同一套码字。

公开资料中有两种值得同时保留的描述:

  • US10476519B2 给出了基于频率的主、二级 Huffman 方案;
  • AtomBeam 当前 How It Works 页面强调码字与源模式取值之间缺少直接推导关系,并介绍随机分配方式。

这两类描述分别强调码长结构和具体码值。产品级评测可以进一步通过互操作资料或黑盒测试确定实际格式。

5. 新源词通过三条路径保持无损

训练码本之外的新源词会触发未命中标记(mismatch/MIS)。随后有三类公开路径。

原文路径

MIS + 原始源词

它提供最直接的兜底能力。高变化数据会更多使用这条路径,因此适合同时配置整记录旁路,控制总体长度。

二级 Huffman 路径

一个长源词可以拆成单 byte,再由覆盖全部 256 种 byte 值的二级 Huffman 字典编码。

长源词
   ↓
byte 1, byte 2, ... byte N
   ↓
二级 Huffman

这条路径利用 byte 级分布,尤其适合长词整体变化、局部 byte 仍有频率偏好的数据。

差分路径

差分(delta)路径选择一个相近参考词,只表达变化位置。

参考词:10110010 01101100
新源词:10110010 01100100
异或:  00000000 00001000

编码器发送参考词、差异中 1 的数量以及位置组合。接收端执行异或即可恢复。

公开说明书还给出 Hamming weight、unary 和 colexicographic rank 等紧凑表示。它们把“若干变化位置”转化为一个组合排名,从而减少稀疏差异的表示长度。

6. 数据路径汇总

输入记录
   ↓
切成源词
   ↓
查询主码本
   ├─ 精确命中 ─────────→ 主码字
   │
   └─ 触发 MIS ─┬──────→ 原文
                 ├──────→ 二级 Huffman
                 └──────→ 参考词 + 差分
   ↓
写入可唯一解析的比特流
   ↓
接收端按相反顺序逐字节恢复

到这里,AtomBeam 公开数据路径已经完整:主码本负责高频模式,三条后备路径负责新模式,解码端负责逐字节无损重建。

二、再看系统:从编码器到完整产品

数据路径解决“怎样编码”,完整系统还要解决“怎样长期稳定运行”。共享码本让这项技术自然形成训练面、数据面和管理面。

1. 训练器选择模型

训练器(trainer)需要完成:

  • 选择代表性训练数据;
  • 确定源词长度;
  • 统计频率并裁剪低频项;
  • 控制主码本容量;
  • 决定原文、二级 Huffman 和差分路径;
  • 选择差分参考词集合;
  • 用验证集比较完整字节成本。

训练数据覆盖正常、启动、故障、升级和任务切换后,码本才能代表真实运行分布。

2. 码本生命周期保持两端一致

生产系统通常需要:

  • 稳定的码本标识和版本;
  • 序列化格式与内容指纹;
  • 编码端和解码端原子切换;
  • 灰度发布与回滚;
  • 旧版本保留;
  • 重启、丢包和乱序后的恢复流程。

这部分体现了产品工程的核心价值:查表只是单次操作,码本生命周期决定整个系统能否持续可靠解码。

3. 运行监测推动自适应

系统可以持续记录:

  • 主码本命中率;
  • 原文、二级编码和差分占比;
  • 每条记录编码长度;
  • 整记录旁路比例;
  • 编解码延迟分位数;
  • 解码成功率;
  • 当前码本版本和分布变化。

这些指标共同支持再训练、码本分发和切换决策。

4. 整记录旁路守住长度上限

编码器完成逐词选择后,再比较整条编码记录与原始记录:

编码记录总长度  vs.  原始记录长度 + 旁路标记

当原始记录更短时,系统直接走旁路。这样既保留了高重复数据的收益,也为高随机数据提供稳定上限。

5. 记录边界完成线上格式

前缀码可以识别码字边界,外层格式还要提供:

  • 记录包含多少个源词;
  • 原始记录长度;
  • 最后一个源词的补齐方式;
  • 下一条记录的起点;
  • 当前码本标识;
  • 路径选择与校验信息。

固定协议可以从外层获得部分信息,通用字节流则显式携带。把这些字段纳入统计,才能得到完整线上字节账本。

三、接着看专利:五个层次组成公开技术体系

按系统层次整理,AtomBeam 的公开专利形成一条由编码到服务的扩展路线。

第一层:共享引用表示

US10303391B2 描述 chunklet、reference code 和共享库。它建立了三项基础能力:

  • 数据内容与引用表示分离;
  • 编码端、存储端和解码端共享兼容库;
  • 引用表示可以用于传输、存储和压缩域操作。

第二层:主编码与新词处理

US10476519B2 给出核心无损路径:

  1. 从代表性数据统计固定长度 word;
  2. 构造第一棵 Huffman tree 和词库;
  3. 精确命中时发送主码字;
  4. 新词触发 MIS;
  5. MIS 后发送原文,或拆成短词交给第二棵 Huffman tree。

US11687241B2 继续讨论失配概率估计与运行时更新。它让 MIS 概率也能随着实际流量调整。

第三层:相似匹配与差分编码

公开说明书描述异或、Hamming weight、unary 和 colex 差异表示。

US12061794B2 和 US12443343B2 又把这一思路扩展为完整架构,涉及:

  • sourceblock hash 或 MinHash;
  • approximation codeword;
  • inverse hash 或近似词恢复;
  • delta codeword 和 delta library;
  • primary stream 与 delta stream;
  • 两条数据流组合恢复。

COMPIN 当前实现覆盖公开说明书中的无损差分表示。完整 hash、inverse hash 和双流架构适合作为后续独立课题。

第四层:模型选择与自适应控制

  • US11385794B2:逐 sourcepacket 比较多个码本结果并关联码本标识;
  • US11422978B2:保存历史分布,检测变化,触发再训练与下发;
  • US12147667B2:根据多个数据源相似度构造组合码本;
  • US12499092B2:训练模型预测适合的源词长度。

第五层:服务化与压缩域能力

专利与复现对应表

系统层公开机制代表专利COMPIN 当前进展
基础表示chunklet、reference code、共享库US10303391B2静态码本子集
主数据路径主 Huffman、MIS、原文、二级 HuffmanUS10476519B2已实现
失配建模失配概率、运行时更新US11687241B2后续研究
差分表示异或、weight、unary、colex说明书公开变体已实现一种无损格式
完整差分架构hash、inverse hash、双流、delta libraryUS12061794B2、US12443343B2后续研究
多模型逐包多码本选择US11385794B2后续研究
漂移闭环监测、再训练、更新下发US11422978B2后续研究
模型组合数据源相似度、组合码本US12147667B2后续研究
块长学习模型预测源词长度US12499092B2后续研究
服务与高层能力服务化、递归、随机访问、协议适配、联邦学习多项后续专利分阶段研究

这套专利体系的技术主线很清楚:先解决短数据编码,再扩展到模型选择、生命周期和压缩域应用。

四、然后看实验:公开机制在四种协议上的表现

1. 实验对象与数据隔离

我们构造了四种固定格式二进制协议:

协议记录长度主要特点
periodic_telemetry40 byte周期状态与缓慢变化数值
command_status32 byte命令、确认与状态组合
event_report48 byte模板化事件和少量变化字段
track_update32 byte连续更新与相邻状态变化

每种协议都有三种运行分布:

  • nominal:与训练阶段相近;
  • drift:字段分布发生系统性变化;
  • noisy:高变化、高随机数据增加。

训练、验证、测试分别使用独立确定性种子。训练集生成候选码本,验证集选择模型,测试集负责最终报告。

2. 可互操作的实验格式

为了保证编码端和解码端逐字节一致,我们明确规定:

  • 源词从记录第 0 byte 开始对齐;
  • 候选长度为 5、8、10、12、15 byte;
  • 主码本采用规范 Huffman;
  • 主树包含 MIS;
  • 新词可以选择原文、完整 1-byte 二级 Huffman 或 colex 差分;
  • 二级编码与差分同时启用时,用 1 bit 选择路径;
  • 差分参考词来自有限候选集合;
  • 每条记录独立补齐到整 byte;
  • 固定协议提供记录类型、原始长度和边界;
  • 码本序列化、计算指纹、重新加载后逐条解码验证。

这些选择形成 COMPIN 的公开实验格式。它与 Neurpac 产品格式分别描述,便于后续独立复现和比较。

3. 验证集选择出的模型

协议方法源词主码本二级字典差分参考词码本大小
periodic_telemetry二级 Huffman5 B12825601,319 B
command_statusMIS + 原文8 B119001,099 B
event_report二级 Huffman12 B82560655 B
track_update二级 Huffman + colex 差分5 B128256321,319 B

4. 计入序列化码本后的数据缩减

正数表示数据量减少,负数表示编码后增加。

协议NominalDriftNoisy
periodic_telemetry50.4%26.4%2.7%
command_status66.6%21.9%−4.0%
event_report75.8%56.2%−35.6%
track_update26.7%25.0%8.6%

这组结果提供了四条有价值的认识:

  1. 高度模板化数据可以取得很高收益。 event_report 在 nominal 下达到 75.8%。
  2. 分布代表性决定码本价值。 同一协议进入 noisy 分布后,结果转为 −35.6%。
  3. 原文路径提供可靠兜底。 command_status 在 noisy 下主要走原文,总代价为 −4.0%。
  4. 差分适合缓慢变化数据。 track_update 的 nominal 流量中,差分路径占 12.3%。

码本大小为 655~1,319 byte,因此长时间持续流量更容易摊销;短会话则适合计算 break-even 消息数。

五、回到指标:每个公开口径怎样获得完整证据

评价性能指标最有效的方法,是把口径转化成明确的测量问题。下面每项都按照“指标含义—成立条件—验证方法—现有观察”展开。

1. 75% 数据缩减:统一字节账本

AtomBeam 的 Compaction vs. Compression 等公开材料给出平均约 75% 的数据缩减口径。我们的 event_report nominal 也得到 75.8%,说明这一量级在高重复场景中具有现实基础。

要把它升级为可推广指标,需要明确:

  • 统计对象是应用载荷、完整记录、网络包还是线上字节;
  • 码本训练、下载、更新和标识怎样摊销;
  • 平均方式按消息、按字节、按设备还是按数据集;
  • nominal、drift、故障和 noisy 的业务权重;
  • 测试集与训练、模型选择的隔离方式;
  • 旁路记录及其标记的统计方法;
  • 对照算法和完整参数。

验证报告可以同时给出:

维度建议指标
数据规模原始字节、记录数、设备数
编码结果编码字节、码本字节、格式字节
分布均值、中位数、p95、最差场景
路径主命中、原文、二级编码、差分、旁路
复现数据哈希、种子、参数、代码版本

现有实验表明,75.8% 可以作为高重复数据的场景结果;drift 与 noisy 结果则帮助确定它的适用范围。两者合在一起,才能形成完整能力画像。

2. 4× 有效带宽:从字节缩减走到链路容量

产品公开说明 使用 4× effective bandwidth 等表述。若完整数据从 100 byte 降到 25 byte,字节容量比确实为 4×。

原始数据:100 B
编码数据:25 B
数据缩减:75%
字节容量比:100 / 25 = 4×

要把字节容量比转化为链路有效带宽,需要满足:

  • 链路以字节容量为主要瓶颈;
  • 节省空间能够装入后续消息;
  • 帧、包或时隙支持相应聚合与复用;
  • 码本、格式、加密、认证和校验均进入账本;
  • 编解码处理速度能够跟上链路;
  • 相同误码、重传和业务负载下比较。

验证方法应直接报告:

  • 每秒成功交付的应用消息;
  • 应用有效吞吐(goodput);
  • 每条消息占用的包、帧或时隙数;
  • 相同链路条件下的时延、丢包和重传;
  • 聚合、padding 与 slot packing 规则。

这样,4× 就从数学换算变成可以在具体链路上重复测量的工程指标。

3. 传输更快:分解为四类速度

“传输速度”可以拆成:

  1. 编码吞吐;
  2. 解码吞吐;
  3. 网络序列化时间;
  4. 应用端到端完成时间。

相应的验证指标包括:

  • 单条消息 p50、p95、p99 编解码延迟;
  • 每核 messages/s 与 Gbit/s;
  • CPU cycles/byte、内存和 cache miss;
  • 训练时间与码本更新时间;
  • 排队、网络、重传和恢复后的端到端时延;
  • 与内存复制、静态表、通用压缩和简单差分的对照。

COMPIN 当前实现已经发现,差分参考词搜索可能成为主要计算代价。每个新词需要比较多个参考词并计算异或、Hamming weight 和组合数长度。因此,主命中路径与差分路径适合分别计时,再按实际占比汇总。

4. 典型码长:与命中率一起解释

How It Works 页面介绍了典型 pattern 和 codeword 长度。精确命中时,64~200 bit 模式替换为 3~10 bit 码字,单次收益十分可观。

完整流量还包括:

主码字
+ MIS
+ 原文 / 二级编码 / 差分
+ 路径选择
+ 补齐
+ 记录边界
+ 码本标识
+ 码本摊销

因此,典型码长与以下指标共同报告时最有解释力:

  • 主码本命中率;
  • 码长分布;
  • 各后备路径占比;
  • 每条记录源词数量;
  • 字节和帧级补齐;
  • 完整记录压缩率。

5. 码本成本:报告摊销曲线

共享码本把训练成本分摊到后续流量。评测可以绘制:

累计原始字节
累计编码字节 + 码本字节
随消息数量变化的净收益

建议报告:

  • 单份码本序列化大小;
  • 每个设备或业务需要的码本数量;
  • 全量和增量更新时间;
  • 设备存储与内存占用;
  • break-even 消息数和 break-even bytes;
  • 旧版本并存与回滚成本;
  • 多码本选择所需标识与搜索开销。

这组曲线会直接显示短会话、长期遥测和频繁更新场景各自的收益区间。

6. 分布漂移:把适应能力纳入主指标

真实系统会经历固件升级、模式切换、故障告警、任务阶段和设备批次变化。完整评测可以采用:

训练分布 → nominal → drift → noisy → 再训练 → 新码本

逐阶段报告:

  • 命中率和编码长度;
  • 旁路比例;
  • 漂移检测时间;
  • 再训练样本量与运行时间;
  • 码本分发字节;
  • 切换期间的连续性;
  • 新码本生效后的恢复幅度。

这样,系统价值从“静态最好压缩率”扩展为“长期运行中的平均净收益”。

7. 安全能力:建立独立威胁模型

码本让数据表示发生变化,并为观察者增加解释门槛。完整安全能力可以由独立密码层提供,包括:

  • 机密性;
  • 身份认证;
  • 完整性;
  • 防重放;
  • 前向安全;
  • 密钥轮换与撤销。

评测时分别测量压缩层和密码层:

  • 码字频率与长度泄露;
  • 已知明文下的映射暴露;
  • 码本分发与完整性保护;
  • 加密前后压缩顺序;
  • 安全层带来的字节与时延成本。

这样可以清晰说明:码本负责紧凑表示,密码协议负责安全保证,两者组合形成完整方案。

COMPIN 已接入公开 SISO-STD-002-2021 的 68-byte DIS Signal PDU 仿真包络,其中 message-specific J-word payload 为合成内容。它完成了第一阶段:验证固定公开包络与编解码流程可以集成。

后续可以沿三阶段推进:

  1. 包络阶段:使用公开 SISO/DIS 格式验证系统集成和逐字节往返;
  2. 消息阶段:依据明确公开的 MIL-STD-6016B 资料构造可追溯字段与业务分布;
  3. 链路阶段:加入公开可验证的帧、时隙、聚合、误码和重传模型,报告 goodput 与时延。

每个阶段分别标注资料来源、版本、字段范围和合成假设。完成第三阶段后,实验就具备讨论 Link 16 场景容量的证据链。

9. 专利与产品:建立机制对应证据

专利提供公开技术方案,产品提供具体实现。二者可以通过以下材料建立对应关系:

  • 产品版本和配置;
  • 互操作格式或公开 API;
  • 产品功能文档;
  • 黑盒输入输出测试;
  • 第三方性能报告;
  • 对应机制的运行指标。

COMPIN 专利复现负责验证“公开机制可以怎样实现”;产品评测负责验证“当前 Neurpac 实际采用哪些机制”。两条证据链相互补充,结论会更加扎实。

六、一份完整独立评测的组织方式

把以上要求汇总,一份可辩护的评测可以按五张表组织。

第一张表:数据与隔离

  • 数据来源、规模、时间范围和协议版本;
  • 训练、验证、测试的独立划分;
  • nominal、drift、故障、noisy 的业务权重;
  • 数据集哈希、生成参数和确定性种子。

第二张表:完整字节账本

项目报告内容
原始数据应用记录字节、记录数
编码数据实际写出的整字节
码本序列化大小、数量、更新字节
线上格式模式位、长度、标识、补齐、校验
网络资源传输头、帧、时隙、重传
最终指标载荷缩减、线上缩减、有效吞吐分别报告

第三张表:算法对照

  • 原始发送;
  • 通用无损压缩;
  • 静态 Huffman;
  • 简单差分或 schema-aware 基线;
  • 主码本;
  • 主码本加二级编码;
  • 主码本加差分;
  • 完整系统加整记录旁路。

所有对照使用同一数据划分和同一成本边界。

第四张表:运行性能

  • 训练时间;
  • 编码和解码吞吐;
  • 单条消息 p50、p95、p99;
  • CPU、内存和 cache 行为;
  • 差分搜索候选数;
  • 多线程扩展;
  • 码本切换期间的时延和连续性。

第五张表:链路效果

  • 完整帧大小;
  • 补齐和最小资源单位;
  • 消息聚合规则;
  • 相同信道下的有效吞吐;
  • 时延、丢包与重传;
  • 每条消息占用的包、帧或时隙数。

这五张表把“压缩率”“速度”“带宽”和“安全”还原为各自独立、又能互相衔接的工程指标。

主要公开来源

公司公开说明:

核心专利:

本文是工程技术调研,服务于技术理解、实验设计和证据建设。

COMPIN 的评价

综合公开专利、公司资料和独立实验,我们对 AtomBeam 形成三点判断。

第一,这是一条值得认真投入的技术路线。 它抓住了短小机器消息跨记录重复的特点,用预训练共享码本降低在线建模成本。主 Huffman、未命中处理、二级编码和差分路径共同构成完整无损数据面;训练、监测、分发和回滚则构成更有工程价值的控制面。

第二,现有实验已经验证了它的条件性优势。 event_report 在 nominal 下达到 75.8%,periodic_telemetry 和 command_status 也获得明显缩减;drift 与 noisy 结果进一步画出了适用范围。把这些场景合并呈现,比单独强调一个最好数字更能说明技术能力。

第三,公开性能口径具备升级为强证据的清晰路径。 统一完整字节账本,可以验证 75% 数据缩减;加入帧、时隙和 goodput,可以验证 4× 有效带宽;补充延迟分位数和 CPU 数据,可以验证传输速度;按公开标准推进消息与链路阶段,可以验证 Link 16 场景。

因此,COMPIN 的总体评价是:

AtomBeam 的公开技术体系具有明确的工程合理性,也展现出处理稳定机器数据的实际潜力。下一阶段应以公开数据、完整线上成本、运行性能和链路级测量,把已有技术优势转化为可重复、可比较、可推广的证据。

我们的研究也将沿这条正向路线继续推进:完善公开协议建模,优化差分搜索,补齐通用基线与整记录旁路,并把数据缩减、有效吞吐、时延和资源占用分别测清楚。