Showing 8 of 8 posts View all posts →
- Paper Reading: Embodied AI 3 - 高效 6D 抓取检测与候选排序
从候选召回、姿态评分到闭环执行,分析 EconomicGrasp、RNGNet、AnyGrasp、GSNet、HGGD 与 GtG 2.0 的取舍。
4 min read - Paper Reading: Embodied AI 2 - 具身推理、跨本体预训练与生成式控制
以 ECoT、RoboPoint、GR-1、HPT、GR-2 和 GR00T N1 为案例,追踪具身中间表示如何连接推理、视频先验与实时控制。
5 min read - Paper Reading: VLA / VLM 2 - 潜动作、分层推理与高效策略
围绕数据利用率、策略分层与在线延迟,评估 UniVLA、GraspVLA、A0、OneTwoVLA、Magma、CoT-VLA、Interleave-VLA 和 SmolVLA。
6 min read - Paper Reading: Embodied AI 1 - 主流模型与具身学习架构
聚焦具身智能中高影响力和高热度的代表论文,覆盖模仿学习、VLA、语言规划、空间推理、大规模数据、生成式策略与抓取感知。
13 min read - Paper Reading: VLA / VLM 1 - 主流模型架构
从图文对比学习、多模态连接器到动作 Token、扩散策略与 Flow Matching,系统梳理 VLM/VLA 主流模型架构和训练目标。
12 min read - Paper Reading: LLM 1 - 主流架构与训练方法演进
从 GPT、BERT、T5 到 MoE、Mamba、Qwen2.5 与 DeepSeek,系统梳理大语言模型的架构、扩展规律、分布式训练和对齐方法。
13 min read - Paper Reading: CV 2 - 三维匹配、持续重建与开放世界感知
以定位、尺度与开放词汇接口为线索,评估 MASt3R、CUT3R、Depth Anything V2、UniDepth、FoundationStereo、Florence-2 和 YOLO-World。
5 min read - Paper Reading: CV 1 - 视觉表征、三维感知与生成式重建
从 CNN、ViT、自监督学习到开放词汇检测、可提示分割、点云 Transformer、深度估计、三维重建和视频预测,系统梳理 CV 主流论文。
11 min read