## 作者信息
> **作者**: 方向 SoloFang
> **邮箱**: solofang@aithisway.shop / solofang@gmail.com
> **项目**: 空间大脑 · 3DWMTP · Growing Minds 项目组

---

# 机器原生语言：技术路线方案 v0.1

> **核心命题**：机器学习是否有一种原生多维方式，对真实世界进行可分解、可理解的互动建模——通过自然语言与 3DWMT（3D World Model Token Protocol）交互后，让机器直接理解需求，基于对物理世界的结构化感知，实现自主学习与物理互操作？

---

## 0. 一句话回答

**有路径。核心拼图已齐 80%，缺失的 20% 正是你定义的 S3（3D Token 通信协议）和 S4（共享世界模型）的标准化实现。本文给出一个从感知到执行再到自主学习、每一层都指明具体可用模型和框架的技术方案。**

---

## 1. 问题拆解

命题中隐含 5 个子问题：

| # | 子问题 | 关键挑战 |
|---|--------|---------|
| 1 | **原生多维感知**：摄像头看到的 2D 像素，如何变成结构化的 3D 物件？ | 从 pixel → 3D object → scene graph |
| 2 | **自然语言 + 3DWMT 双通道交互**：人说话 → 机器用 3D 空间语言理解意图 | 语言 grounding 到 3D 空间中的具体 token |
| 3 | **3D 空间意识**：机器对世界有持续的、可更新的 3D 空间模型 | 动态场景图中的持久化 object ID + 空间关系 |
| 4 | **自主学习和物理互操作**：机器在新环境中自己学会怎么操作物体 | World Model + RL + 在线自适应 |
| 5 | **端到端闭环**：所有层协同工作，从指令到执行 | 协议标准化 + 延迟可控 |

---

## 2. 总体架构：5 层能力栈

```
┌─────────────────────────────────────────────────────────────┐
│                     人 类 用 户                              │
│   "把桌上的红杯子放到洗碗机里"                                │
└────────────────────────┬────────────────────────────────────┘
                         │ 自然语言
                         ▼
┌─────────────────────────────────────────────────────────────┐
│  L5: 语言桥（Language Bridge）                               │
│  功能：自然语言 → 3DWMT 查询/指令                            │
│  技术：VLM（GPT-4V/Gemini）+ Structured Extraction          │
│  输出：["locate(obj=cup_red,on=table)", "execute(           │
│         place(obj=cup_red,to=dishwasher))"]                 │
└────────────────────────┬────────────────────────────────────┘
                         │ 3DWMT 指令流
                         ▼
┌─────────────────────────────────────────────────────────────┐
│  L4: 世界模型（World Model）                     【S4】      │
│  功能：在 latent 3D 空间中预测物理变化                        │
│  技术：DreamerV3 RSSM + 3D Token 输入适配                   │
│  输出：3DWMT token 的下一步预测（位置/速度/交互状态）          │
└────────────────────────┬────────────────────────────────────┘
                         │ 状态预测 + 规划
                         ▼
┌─────────────────────────────────────────────────────────────┐
│  L3: 3D 通信协议层（3DWMT）                      【S3】      │
│  功能：机器内部 + 机器之间的 3D 空间语言                      │
│  技术：结构化 Token 流 + 空间索引 + Pub/Sub                  │
│  输出：[{obj_id,class,pos_3d,bbox,vel,material,affordance}] │
└────────────────────────┬────────────────────────────────────┘
                         │ 3DWMT Token 流
                         ▼
┌─────────────────────────────────────────────────────────────┐
│  L2: 空间感知层（Spatial Perception）            【S2】      │
│  功能：2D 像素 → 3D 结构化物件 + 场景图                       │
│  技术：SAM 2 + Depth Anything v2 + DUSt3R + VideoLISA       │
│  输出：3DWMT token 的 obj_class、pos、bbox、trajectory       │
└────────────────────────┬────────────────────────────────────┘
                         │ 原始传感器信号
                         ▼
┌─────────────────────────────────────────────────────────────┐
│  L1: 传感与执行层（Sensing & Actuation）         【S1】      │
│  功能：摄像头/LiDAR/触觉 → 数字信号；动作 → 物理力            │
│  技术：多模态传感器阵列 + 实时控制总线（EtherCAT/ROS 2）       │
│  物理载体：机械臂 × 2 + 灵巧手 + 多视角摄像头                 │
└─────────────────────────────────────────────────────────────┘
```

---

## 3. 各层技术方案（具体到模型和框架）

### L1：传感与执行层

| 组件 | 技术选型 | 理由 |
|------|---------|------|
| 视觉 | 4× RGB-D 摄像头（Intel RealSense D457）| 多视角覆盖工作空间，RGB + 深度同步 30fps |
| 触觉 | GelSight Mini / DIGIT | 指尖触觉，分辨力 0.01mm 级别 |
| 本体感 | 机械臂内置编码器（7-DoF 关节角度）| 标准工业精度 |
| 执行 | Franka Emika Panda × 2 | 7-DoF，力矩控制，ROS 2 原生支持 |
| 实时控制 | ROS 2 + ros2_control + EtherCAT | 毫秒级控制回路，DDS 中间件 |

**L1 层的 3DWMT 输出格式**（传感数据统一编码为 token）：

```python
# 摄像头帧 → L2 的标准输入格式
sensor_token = {
    "timestamp": 1718300000.123456,
    "source": "cam_front",
    "rgb": "base64_encoded_jpeg",       # 或原始 tensor 引用
    "depth": "base64_encoded_png",
    "intrinsics": [fx, fy, cx, cy],     # 相机内参
    "extrinsics": 4×4_matrix,           # 世界坐标系位姿
    "resolution": [1280, 720]
}
```

---

### L2：空间感知层（S2）

**核心任务**：从多视角 RGB-D → 统一的世界坐标系 3DWMT Token。

#### 2.1 2D → 3D 重建（瞬时帧）

```
多视角 RGB-D 输入
       │
       ▼
┌──────────────────────────────┐
│  DUSt3R / MASt3R             │  ← 无需相机标定的 3D 重建
│  (CVPR 2024, Naver Labs)     │    直接输出 dense point cloud
└──────────────┬───────────────┘
               │ 密集点云
               ▼
┌──────────────────────────────┐
│  SAM 2 (Segment Anything 2)  │  ← 像素级分割 + 跟踪
│  (Meta, 2024)                │    输出 instance masks
└──────────────┬───────────────┘
               │ 分割 mask + 点云
               ▼
┌──────────────────────────────┐
│  Open-Vocabulary Detector     │  ← 识别物体类别（不限于预定义类）
│  (OWLv2 / GroundingDINO)     │    "red cup on table" → bbox
└──────────────┬───────────────┘
               │ {mask, class, bbox_3d}
               ▼
┌──────────────────────────────┐
│  3D Object Tracker           │  ← 跨帧绑定 object_id
│  (MegaPose + Kalman Filter)  │    同一物体在时序中保持一致
└──────────────┬───────────────┘
               │ {obj_id, class, pos, vel, ...}
               ▼
          3DWMT Token（注入 L3）
```

#### 2.2 时间维度的感知（视频流 → 动态场景图）

```
Video stream (30fps)
       │
       ▼
┌──────────────────────────────┐
│  VideoLISA                    │  ← video object segmentation
│  (reasoning-based tracking)  │    基于语义推理的长时跟踪
└──────────────┬───────────────┘
               │ object tracklets
               ▼
┌──────────────────────────────┐
│  Spatial Relation Extractor   │  ← 提取空间关系
│  (基于 3D bbox + 规则引擎)    │    "cup ON table", "cup NEAR plate"
└──────────────┬───────────────┘
               │
               ▼
      Dynamic 3D Scene Graph
      {
        nodes: [{obj_id:"cup_42", class:"cup", color:"red", ...}],
        edges: [{src:"cup_42", rel:"on", tgt:"table_01"}, ...],
        timestamp: 1718300000.xyz
      }
```

#### 2.3 L2 的关键选型理由

| 模型 | 为什么选它 | 替代方案 |
|------|----------|---------|
| DUSt3R | 无需相机标定、无需深度传感器就能出密集 3D | COLMAP（太慢）、NeRF（推理慢）|
| SAM 2 | 视频级分割 + 零样本跟踪，精度 SOTA | DEVA（精度略差）|
| OWLv2 | 开放词汇检测，不受类别限制 | Detic（词汇量受限）|
| VideoLISA | 推理级跟踪——"跟着那个红色的杯子"而非像素匹配 | ByteTrack（纯像素匹配，易跟丢）|
| MegaPose | 6-DoF 位姿估计 SOTA，支持纹理少物体 | FoundationPose（更新但生态不如 MegaPose）|

---

### L3：3DWMT 协议层（S3）—— 最核心的原创层

#### 3.1 3DWMT Token 的正式定义

```python
from dataclasses import dataclass
from typing import Optional, List
import numpy as np

@dataclass
class ThreeDWorldModelToken:
    """3DWMT - 3D World Model Token Protocol v0.1"""
    
    # ===== 必选字段 =====
    obj_id: str                     # 全局唯一 ID，跨帧持久化
    timestamp: float                # Unix 时间戳（秒，纳秒精度）
    
    # ===== 空间字段 =====
    pos_3d: np.ndarray              # (3,) 世界坐标系中心点
    bbox_3d: np.ndarray             # (8, 3) 世界坐标系包围盒角点
    orientation: np.ndarray         # (4,) 四元数 [qx, qy, qz, qw]
    velocity: Optional[np.ndarray]  # (3,) 线速度 m/s
    angular_velocity: Optional[np.ndarray]  # (3,) 角速度 rad/s
    
    # ===== 语义字段 =====
    class_name: str                 # 物体类别（开放词汇）
    attributes: dict                # {"color": "red", "material": "ceramic", ...}
    affordances: List[str]          # ["graspable", "pour", "stackable", ...]
    
    # ===== 关系字段 =====
    spatial_relations: dict         # {"on": "table_01", "near": ["plate_03", "fork_12"]}
    parent_obj_id: Optional[str]    # "table_01"（如果杯子在桌上）
    is_moving: bool                 # 是否在运动
    is_grasped: bool                # 是否被抓取
    
    # ===== 置信度字段 =====
    detection_confidence: float     # 检测置信度
    tracking_confidence: float      # 跟踪置信度
    pose_confidence: float          # 位姿置信度
    
    # ===== 协议字段 =====
    token_version: str = "3dwmt.v0.1"
    encoding: str = "binary"        # "binary" 或 "json"（调试用）
    source_agent: str = "robot_A"   # 生成此 token 的 agent
```

#### 3.2 Token 流的组织方式

```
不是时序列表，而是空间索引 + 时序差分：

┌──────────────────────────────────────────────────────┐
│                  3DWMT Token Bus                     │
│                                                      │
│  ┌──────────────┐  ┌──────────────┐  ┌─────────────┐│
│  │ Spatial Index │  │ Object Cache │  │ Event Queue ││
│  │ (Octree)     │  │ (by obj_id)  │  │ (FIFO)      ││
│  │              │  │              │  │             ││
│  │ 快速查询:     │  │ 快速查询:     │  │ 订阅:       ││
│  │ "0.3m内的     │  │ "cup_42的     │  │ "obj_moved" ││
│  │  所有token"   │  │  最新状态"    │  │ "obj_added" ││
│  └──────┬───────┘  └──────┬───────┘  │ "obj_removed"││
│         │                 │           └──────┬──────┘│
│         └────────┬────────┘                  │       │
│                  ▼                           ▼       │
│           查询 API (REST/gRPC)        推送 API (WebSocket)│
│           L4 世界模型调用              L5 语言桥订阅    │
└──────────────────────────────────────────────────────┘
```

#### 3.3 为什么要空间索引而不是时序列表

```
时序列表（当前所有 VLA 的做法）：

  [cup, cup, cup, table, table, cup, plate, ...]
  → "桌子在哪？" → 扫描整个列表 → O(n)


空间索引 + 对象缓存（3DWMT 的做法）：

  "桌子在哪？" → cache["table_01"] → O(1) 直接返回
  "杯子附近有什么？" → spatial_query(pos=cup.pos, radius=0.3m) → O(log n)
  "场景变化了哪些？" → event_queue.pop_all() → O(1)
```

#### 3.4 3DWMT 的序列化格式（用于实际传输）

```python
# Binary 高效传输格式（类 Protobuf）
# 单个 token ~96 bytes

"""
Byte Layout:
  0-7:   double timestamp           (8 bytes)
  8-23:  char[16] obj_id            (16 bytes, null-padded)
  24-47: float32[6] bbox_min+max    (24 bytes, 本地坐标系)
  48-63: float32[4] quaternion      (16 bytes)
  64-79: float32[4] pos+confidence  (16 bytes, z 压缩为 fp16)
  80-87: int32[2] class+attrs_hash  (8 bytes, 哈希索引到字典)
  88-95: uint8[8] flags+reserved    (8 bytes, is_moving, is_grasped, ...)
"""
```

---

### L4：世界模型层（S4）

#### 4.1 设计目标

世界模型需要回答三个问题：
1. **如果我推这个杯子，它会怎么动？**（物理预测）
2. **如果我把杯子移动到这里，碗会不会被碰倒？**（空间推理）
3. **如果不抓这个把手而是抓杯身，哪种更稳？**（affordance + 稳定性推理）

#### 4.2 技术路线：3D 增强的 RSSM

```
传统 DreamerV3:
  观测 → CNN encoder → latent z → RSSM → reward + action

3D 增强版（3DWMT-Dreamer）:
  观测 → L2 感知（3DWMT token） → token encoder → RSSM → 3DWMT 预测
         ↑                                                ↓
    3DWMT Bus ←────────────────── 反馈预测到 S3 ────────┘

关键改进：
  1. 输入不再是从像素直接编码的 1D latent，而是 3DWMT token 的 embedding
  2. RSSM 的 latent state 被约束为可解码回 3DWMT token（结构化 latent）
  3. 物理预测输出的是"下一步的 3DWMT token 状态"，可直接验证
```

#### 4.3 世界模型的训练数据

| 数据来源 | 内容 | 用途 |
|---------|------|------|
| **Genesis**（物理仿真平台）| 大规模自动生成交互场景 | 预训练物理直觉 |
| **Isaac Sim** | NVIDIA 官方机器人仿真 | Domain Randomization |
| **BridgeData V2** | 真实机器人操作数据（60k+ episodes）| 微调 |
| **Open X-Embodiment** | 跨机器人平台的大规模操作数据 | 泛化 |

#### 4.4 世界模型的两阶段学习

```
阶段 1：物理预训练（仿真中，离线）
  目标：学会"物体碰撞后如何运动"
  方法：Genesis 生成数百万个 3DWMT token 序列
        → 训练 RSSM 预测 t+1 的 3DWMT token
        → 损失函数：pos_error + quat_error + contact_prediction_accuracy

阶段 2：任务适配（少量真实数据微调）
  目标：校准仿真与现实之间的 domain gap
  方法：100 次真实操作演示 → RSSM 微调最后一层
        → 其他层冻结（保留仿真学的物理知识）
```

---

### L5：语言桥（Language Bridge）

#### 5.1 设计目标

人类说自然语言 → 系统生成可执行的 3DWMT 查询 + 操作序列。

```
"把桌上的红杯子放到洗碗机里"
         │
         ▼
┌────────────────────────────────────────┐
│  VLM (GPT-4V / Gemini 2.5 Pro)        │
│  输入：当前场景的 3DWMT tokens 文本描述  │
│       + 自然语言指令                    │
│  输出：结构化任务计划 + token 引用       │
└────────────────────┬───────────────────┘
                     │
                     ▼
    [
      {
        "intent": "locate",
        "query": {
          "class": "cup",
          "attribute": {"color": "red"},
          "spatial_relation": {"on": "table"}
        },
        "target_token": null  // 将由 L3 查询填充
      },
      {
        "intent": "grasp",
        "target_token": "cup_42",
        "grasp_type": "top",  // 从 affordance 字段自动推导
        "approach": {"direction": [0, 0, -1], "distance": 0.1}
      },
      {
        "intent": "place",
        "target_token": "cup_42",
        "destination_token": "dishwasher_03",
        "destination_region": "top_rack"
      }
    ]
```

#### 5.2 语言桥的三种交互模式

| 模式 | 自然语言 | 3DWMT 指令 | 适用场景 |
|------|---------|-----------|---------|
| **声明式** | "这个房间有两个杯子" | `query: class=cup → count` | 场景理解 |
| **指令式** | "把红杯子拿过来" | `grasp(target=cup_42) → place(target=robot_B_hand)` | 单步操作 |
| **意图式** | "把桌子收拾干净" | `plan: remove_all(obj.on=table) → sort(obj.class)` | 多步规划 |

---

## 4. 自主学习管线（完整流程）

```
Phase 0: 先验知识注入（离线）
  ┌─────────────────────────────────────┐
  │  大规模预训练                        │
  │  · Genesis 仿真：100 万+ 物理交互    │
  │  · Open X-Embodiment：跨机器人泛化  │
  │  · Internet-scale vision-language   │
  └──────────────┬──────────────────────┘
                 │
Phase 1: 零样本部署（首次开机）
  ┌─────────────────────────────────────┐
  │  · L2 自动感知：摄像头 → 3DWMT tokens│
  │  · L4 世界模型：已从仿真学会基本物理  │
  │  · L5 语言桥：理解"这是厨房"         │
  │  状态：能看、能识别、但不能操作      │
  └──────────────┬──────────────────────┘
                 │
Phase 2: 示教学习（人类教 5-10 次）
  ┌─────────────────────────────────────┐
  │  · 人拖拽机械臂完成任务               │
  │  · 系统记录：3DWMT token 轨迹 + 力觉  │
  │  · BC（行为克隆）初始化策略           │
  │  状态：能复现教过的任务               │
  └──────────────┬──────────────────────┘
                 │
Phase 3: RL 自主精调（机器自己练习）
  ┌─────────────────────────────────────┐
  │  · 在仿真中（Genesis）随机变化场景    │
  │  · 3DWMT 驱动的奖励函数：             │
  │    - pos_error → 3D 距离             │
  │    - contact_quality → 触碰力         │
  │    - success = 语义层判断              │
  │  · PPO + KL 约束（不偏离 BC 太远）    │
  │  状态：能在变化中稳定完成任务          │
  └──────────────┬──────────────────────┘
                 │
Phase 4: 在线自适应（工作中持续学习）
  ┌─────────────────────────────────────┐
  │  · 执行失败 → 记录失败 token 状态    │
  │  · 在线微调 RSSM 世界模型             │
  │  · 增量更新策略（不覆盖已有技能）      │
  │  · 安全约束：从未见过的动作 → 拒绝     │
  │  状态：越用越好，适应新环境            │
  └─────────────────────────────────────┘
```

---

## 5. 关键技术挑战与解决方案

### 5.1 延迟——最致命的工程问题

```
理想链路延迟：
  camera → L2(50ms) → L3(5ms) → L4(20ms) → RL policy(10ms) → control(2ms)
  = 87ms total → 约 11.5Hz

如果做一次 VLM 调用（L5 参与闭环）：
  VLM API call: 500ms-2000ms → 只能用于规划层，不能用于实时控制
```

**解决方案**：快慢双环

```
慢环（2-5Hz）：L5 语言桥规划
  "我看到场景变化了，重新规划" → 调用 VLM → 更新目标

快环（50-100Hz）：L2-L3-L4-Policy 自主执行
  不经过 VLM，纯 3DWMT token 驱动的闭环控制
```

### 5.2 物体 ID 的持久化——杯子被挡住怎么办

```
SAM 2 的跟踪在以下情况会断裂：
  · 物体被完全遮挡 > 2 秒
  · 物体离开视野再回来
  · 物体从不同角度看起来差异很大
```

**解决方案**：多模态 ID 绑定

```python
object_identity = hash(
    spatial: 最后已知位置 + 运动预测,
    visual:  DINOv2 feature vector,
    semantic: class + attributes,
    temporal: 出现/消失的时间窗口
)

# 重新出现时匹配阈值:
if similarity(new_object, cached_identity) > 0.85:
    assign_same_id(new_object, cached_object)
```

### 5.3 仿真到真实的 Domain Gap

**解决方案**：渐进式 Real2Sim2Real

```
步骤 1: 在真实世界录 1 次操作 → 回放为 3DWMT token 序列
步骤 2: 在 Genesis 中重建同一场景（Gaussian Splatting → mesh）
步骤 3: 在重建的"数字孪生"中做 Domain Randomization（1000 次变化）
步骤 4: 学到的策略部署回真实世界
步骤 5: 真实世界 10 次自适应微调（online RL with safety shield）
```

---

## 6. 最小可行实验（PoC）设计

**目标**：用最少的资源验证"3DWMT 驱动的自主操作"是否可行。

### 实验设置

| 项目 | 选择 |
|------|------|
| 硬件 | Franka Panda × 1，3× RealSense D435，1× GelSight |
| 任务 | "把桌上的红色方块放到蓝色方块旁边" |
| 物体 | 3D 打印的标准化几何体（5 色 × 3 形状） |
| 环境 | 固定桌面，均匀光照（先降低变量） |

### 实验指标

| 指标 | 基线（纯 BC） | 目标（BC + 3DWMT RL） |
|------|-------------|---------------------|
| 任务成功率 | ~70% | >90% |
| 泛化到新位置 | ~40% | >80% |
| 泛化到新颜色 | ~30% | >75% |
| 单次推理延迟 | — | <100ms |
| 从 5 次示教到自主泛化 | 不支持 | 支持 |

### 实验流程

```
Day 1-2:  环境搭建（校准、ROS 2 配置、3DWMT Bus 启动）
Day 3-4:  示教数据收集（人类拖拽完成 50 次任务）
Day 5-7:  离线训练（BC → 仿真 RL → 真实微调）
Day 8:    评估（成功率 + 泛化 + 延迟）
Day 9-10: 分析 + 迭代
```

---

## 7. 与现有工作的边界声明

| 你的框架 | 最接近的现有工作 | 你的贡献 |
|---------|----------------|---------|
| L1 传感执行 | ROS 2, EtherCAT | 无——成熟技术，照搬即可 |
| L2 空间感知 | SAM 2 + DUSt3R + OWLv2 | 无——组合已有 SOTA 模型。你的贡献在 **L2→L3 的统一输出格式** |
| **L3 3DWMT** | CommNet, TarMAC（1D 向量通信）| **核心原创**：结构化 3D token 通信协议 + 空间索引 |
| **L4 共享世界模型** | DreamerV3, RSSM（单智能体）| **核心原创**：3DWMT token 驱动的多智能体共享世界模型 |
| L5 语言桥 | GPT-4V + Code-as-Policy | 你的贡献在 **输出格式的统一**：不是 Python 代码，而是 3DWMT 查询语言 |

---

## 8. 实施路线图

```
Q3 2026 ──── PoC 验证 ────
  · 搭建感知栈（SAM2 + DUSt3R → 3DWMT）
  · 单臂方块搬运实验
  · 验证 L2→L3 链路延迟和精度
  · 产出：PoC 实验报告 + 开源 3DWMT v0.1 协议定义

Q4 2026 ──── 核心系统 ────
  · 3DWMT Bus 完整实现（空间索引 + 事件推送）
  · 接入 DreamerV3 世界模型
  · BC + RL 训练管线
  · 产出：可展示的自主操作 Demo

Q1 2027 ──── 多机协同 ────
  · 双臂实验（传杯子、协作拼装）
  · 共享世界模型验证（两台机器人共享同一 3DWMT Bus）
  · 产出：多机 Demo + 论文初稿

Q2 2027 ──── 论文 + 开源 ────
  · 论文投稿（目标：CoRL 2027 / RSS 2027）
  · 开源 3DWMT 协议 + 参考实现
  · 产出：论文 + GitHub repo
```

---

## 9. 一句话总结

> **这套方案的核心洞察**：当前 AI 不缺感知能力（SAM 2、DUSt3R 已经够好），不缺推理能力（GPT-4V、DreamerV3 已经够强），不缺执行能力（机械臂、灵巧手已经够准）——缺的是**连接它们的一门语言**。3DWMT 就是这门语言——它把"摄像头看到什么"、"世界将如何变化"、"机器人该怎么做"用同一套 3D 空间 token 协议串起来。

---

## A. 依赖清单（具体版本）

```yaml
感知层:
  segment-anything-2: "Meta SAM 2 (2024)"
  dust3r: "Naver Labs (CVPR 2024)"
  owl-vit: "Google OWLv2 (ECCV 2024)"
  video-lisa: "VideoLISA (NeurIPS 2024)"
  
世界模型:
  dreamerv3: "Danijar Hafner (2023)"
  genesis: "Genesis Physics Engine (2024)"

仿真:
  isaac-sim: "NVIDIA Isaac Sim 2024.1"
  
控制:
  ros2: "Humble Hawksbill"
  ros2_control: "latest"

语言桥:
  gpt-4v: "OpenAI (或 Gemini 2.5 Pro)"
  instructor: "Structured Output for LLMs"
```

---

*版本：v0.1*
*日期：2026-06-14*
*下一版计划：补充 L3 协议的形式化规范（Protobuf 定义）、PoC 实验详细设计*
