美日德全球最新动态 | 智能驾驶 | 电动车 | 无人驾驶技术 | 中英对照 | AI 解读 | 语音播报
🤖 由 Agent394 自动维护
最后更新:2026-08-09 14:02:43 (GMT+8) | 每天自动更新
Whether you want them or fear them, robotaxis should be running in Denver before the end of 2026. Here’s what to know about Waymo.
无论你期待还是担忧,Waymo 的无人驾驶出租车(Robotaxi)预计将在 2026 年底前于丹佛市正式投入运营。以下是关于 Waymo 自动驾驶服务的详细信息。
Waymo 正在把L4级自动驾驶的路测范围加速向东西海岸之外拓展,Denver的高原地形和冬季冰雪路况是对其感知算法和底盘控制很好的极端场景验证。自动驾驶行业的商业化已从“能不能跑”进入到“规模化区域拓展”的拼图阶段,留给国内创业公司的时间窗口不多了。
The self-driving car company Waymo has moved to the next phase of testing in Denver by removing the backup drivers.
自动驾驶公司 Waymo 在丹佛推进至下一阶段测试,正式移除了车内的人类备用驾驶员(backup drivers)。
取消安全员是Robotaxi实现商业闭环的生死线,说明Waymo的第五代系统在应对丹佛的高原地形和降雪天气时已经有了底。对于从业者来说,多一个城市实现全无人,意味着软件算法的泛化能力终于跨过了区域特性的拐点。
Switzerland plans a 500-km underground freight network, but financing and approvals stand between vision and reality.
瑞士计划打造一个长达500公里的地下货运网络,利用自动驾驶车辆在日内瓦和康斯坦茨之间运输货物,但愿景落地仍面临融资和审批的巨大阻碍。
把自动驾驶从开放道路转移到封闭地下隧道,变相抹平了长尾 Corner Case 的技术难点,工程落地极快。但这种重资产基建的命脉不在 AI 算法,而在政府批地和财团的资金链,短期内只能当做特种物流场景的个案看。
Robotaxi companies are scaling their operations as they continue to run into driving scenarios that could trip up the AI ...
Robotaxi 公司在不断扩大运营规模的同时,依然会不断遇到可能导致 AI 系统出错的复杂驾驶场景。
这是一种典型的互联网产品思维在自动驾驶上的套用:先抢占运力和乘客数据,把长尾场景留到海量实跑中去迭代。代价是高昂的远程安全接管成本,谁能先把接管率压下去,谁就能熬过下一轮烧钱期。
The history of networking is full of tools that repurposed solutions to very different kinds of problems first. Wi-Fi’sorigins trace backin part
回顾网络通信发展史,许多工具最初是为解决完全不同的问题而设计的。例如,如今广泛用于无线上网的Wi-Fi技术,其部分起源实际上是对扩频通信等其他领域既有通信方案的重新利用与改造。本文以此类比探讨了当前车辆间(V2V)通信标准的演进路径。
V2X(车联网)和车路协同搞了这么多年一直没大规模落地,不是因为技术不够好,而是卡在商业利益和频段划分上。文章借Wi-Fi的历史暗示:V2V可能需要的不是更复杂的物理层协议,而是更开放、去中心化的架构复用。
LiDAR-based Scene Coordinate Regression (SCR) maps point clouds directly to 3D scene coordinates, enabling precise 6-DoF localisation without explicit map retrieval. However, existing methods produce ...
基于LiDAR的场景坐标回归(SCR)技术直接将点云映射为3D场景坐标,无需维护庞大的局部地图即可实现精确的6自由度定位。本文提出UQ-Loc,在此基础上引入不确定性量化,过滤掉因动态障碍物或距离过远导致的低置信度坐标回归结果。
丢掉高精地图直接回归坐标确实快,但遇到遮挡或者空旷地带容易输出离谱坐标。引入不确定性评估后,系统能知道“自己定位不准了”,从而平滑切换回GNSS或请求重定位,提升了系统的下限保障。
Hierarchical 3D scene graphs are a promising representation for high-level spatial reasoning in autonomous mobile platforms. However, existing extraction frameworks typically rely on purely local visu...
3D场景图(将环境表示为物体及其关系的网络)是移动平台进行高级空间推理的关键。现有提取方法过于依赖局部视觉特征。本文提出Prior-SG,结合特定任务需求与先验知识,将场景分割为带有逻辑层级的区域块,大幅提升机器人在任意复杂环境下的拓扑理解能力。
这改变了以往见树就是树、见路就是路的低级建图模式。把环境抽象为逻辑图谱,极大压缩了复杂场景的表征维度。做基于语义地图的自动驾驶规划或自主移动机器人(AMR)的同学可以直接用这套接口。
Effective Visual Localization (VL) requires a map of the environment that combines compactness for efficient scalability with robustness against visual appearance changes and metric precision. Through...
有效的视觉定位需要在地图紧凑性(便于快速扩展存储)以及对光照变化的鲁棒性之间取得平衡。本文结合深度视觉嵌入特征与前馈3D场景模型,生成高紧凑性的环境语义地图,无需复杂迭代计算即可实现高精度、抗光照变化的厘米级车辆定位。
比起动辄几个G的激光雷达高精点云图,这种结合视觉特征的向量地图体积小得可怕,对城市级NOA“轻地图”方案的建图、发版和车端实时下载来说简直是量身定制。
Large video diffusion models provide rich spatiotemporal priors for autonomous driving, but existing world-action models often inherit the cost of iterative future-video generation even though deploym...
大型视频扩散模型(World Models)能为自动驾驶提供丰富的时空先验,但其逐步迭代生成视频的耗时过长,难以满足车端实时部署。本文提出Adaptive-WAM,利用质量引导机制,允许规划器在视频生成中间阶段(尚未渲染完)直接提取特征进行规划,实现早期退出。
搞端到端大模型最怕的就是推理耗时不可控。这种基于质量评估的“随时退出”机制,允许系统在算力充裕时多算两帧、算力吃紧时提前截断,是解决车端实时性死穴的务实工程解法。
High-definition 3D LiDAR maps are important for autonomous driving and smart-city services, which require reliable detection of object-level changes in multi-temporal urban LiDAR to keep digital maps ...
高精度3D激光雷达地图对于自动驾驶和智慧城市至关重要,需要可靠检测多时间点采集的城市激光雷达数据中的对象级变化(如新建建筑、移除的护栏),以保持地图的新鲜度。本文提出检测级别感知的LoDA方法及多模态基准数据集,精准识别地图中的动态目标。
解决的是众包建图和地图更新中“什么变了”的核心问题。通过剔除动态变化的对象来维持地图的高鲜度,直接降低车端重绘地图的频率和云端建图的带宽成本。
The transition from the classical ECDSA to PQC creates substantially larger authentication payloads for safety-critical C-V2X sidelink communication. This study determines which NIST post-quantum sign...
随着量子计算发展,传统ECDSA加密面临破解风险。从传统加密向后量子密码(PQC)过渡会使得车联网(C-V2X)安全认证载荷大幅增加。本论文全面评估了NIST提出的多种后量子签名算法在资源受限的V2X直连通信中的实际部署延迟与可行性。
车企必须在现有T-Box和路侧单元的算力里提前留好后量子加密的算力冗余。这篇论文给出的各种PQC算法的通信负载和验证耗时数据,是做V2X硬件架构设计最直接的参考。
Defensive driving scores are useful only when they preserve distinctions between policies that observe surrounding actors and those that do not. Re-simulation benchmarks may use reference-conditioned ...
防御性驾驶评分(一种评估自动驾驶车辆是否能主动避让潜在危险的指标)只有在能区分“系统是否观察到了周围车辆”时才有价值。研究发现当前的重仿真测试基准存在作弊空间,允许系统在不真正感知周围环境的情况下获得高分,本文对此进行了机制剖析与修正。
这揭开了端到端评测的遮羞布:很多高分的智驾系统只是拟合了评测指标里的数据分布,而不是真的懂防御性驾驶。做仿真平台和Benchmark的团队需要警惕这种指标过拟合现象。
The vision for 6G vehicle-to-everything (V2X) communications demands reliable, adaptive connectivity for fully autonomous driving across complex dynamic environments. Millimeter-wave (mmWave) user ass...
6G车联网(V2X)在复杂动态环境中需要高度可靠的连接,而毫米波通信极易受到车辆移动和建筑物遮挡影响。本文提出一种基于多臂老虎机机制的半分布式用户关联算法,动态分配网络资源,有效克服毫米波在高速移动下的信号遮挡问题。
5G/6G的毫米波确实快,但在车联网里一挡就断是致命伤。用强化学习动态切换毫米波基站不仅降低了核心网信令开销,也为高阶自动驾驶的冗余通信提供了一套低成本的落地思路。
The ability to accurately assess and anticipate risks in safety-critical scenarios is crucial for autonomous driving systems. While existing research has made progress in collision prediction, accurat...
准确评估和预判安全关键场景(如极端碰撞隐患)是自动驾驶落地的核心。本论文结合神经语义场(将3D空间映射为带语义特征的隐式表征)与分层风险感知树(HRPT),不仅能预测是否会发生碰撞,还能从空间和逻辑层面解析风险的因果链条。
对保险公司和Robotaxi运营平台来说非常有用,它给出了不仅限于物理碰撞的风险度量体系。以后做Scenario-based(基于场景)的测试集筛选可以用这套方法自动挖掘危险场景。
Automatic train operation (ATO) at grade of automation 3 and above (GoA3-GoA4) requires robust AI-based perception systems capable of reliably detecting obstacles and railway-specific objects under re...
达到GoA3-GoA4级别(高度自动化至无人驾驶)的自动列车运行(ATO)系统需要极度可靠的AI感知网络来识别轨道障碍物。本文提出一种结合GitOps理念(使用Git作为单一事实来源自动化管理基础设施)的标注目录,实现铁路感知数据的持续集成与模型自动化迭代。
铁路智驾和公路智驾的数据处理逻辑不同,轨道场景更需要精准的版本控制。将数据标注和模型迭代的CI/CD流程通过GitOps管理,极大降低了特殊路段长尾数据更新上线的周期。
Reliable environment monitoring is essential for the safe and efficient operation of automated railway systems, covering all Grades of Automation (GoA), from partially automated (GoA2) to fully automa...
可靠的环境监控覆盖从部分自动化(GoA2)到完全无人驾驶(GoA4)的所有铁路运营场景。为填补数据空白,本文发布了一套包含相机、激光雷达等多传感器的大型铁路真实运营环境数据集,专门用于训练和验证轨道环境下的鲁棒感知模型。
行业一直缺高质量的铁路公开数据集,这补齐了轨道交通自动化的基础设施短板。做3D感知和SLAM的团队可以拿这个数据测试算法在狭长、规则且高反光铁轨环境下的鲁棒性。
Accurate six-degree-of-freedom (6-DOF) motion estimation is essential for robotic manipulation, autonomous systems, and structural displacement monitoring. Conventional 3D-2D methods estimate absolute...
精确的六自由度(6-DOF,三个平移+三个旋转)运动估计对机器人操作至关重要。传统3D-to-2D方法在估计绝对位姿时极易受相机标定误差影响,本文提出一种微分位姿估计方法,在数学可证层面实现对相机标定误差的一阶免疫,提升位姿估计稳定性。
“一阶免疫”是个硬核的数学保证,意味着即使相机因为长期震动产生微小焦距或光轴偏移,也不会破坏视觉里程计的基础矩阵。这对需要长期免维护运行的低速无人配送车和清扫车极其关键。
NVIDIA released Alpamayo 2 Super, a 34B vision-language-action model for autonomous driving, under OpenMDW-1.1 — a permissive license covering fine-tuning, derivatives and commercial redistribution. I...
英伟达(NVIDIA)发布参数量达340亿的视觉-语言-动作模型(VLA)Alpamayo 2 Super,专攻Robotaxi与自动驾驶。该模型在OpenMDW-1.1协议下开源,完全支持模型的微调、衍生创作和商业再分发。
340亿参数的基础模型通过完全商用友好的协议放出,说明英伟达在端到端智驾领域要复刻CUDA时代的“卖铲子”逻辑。国内做端到端大模型的初创公司和车企可以直接拿来做底座,省去从零预训练的算力费。
As a key capability for embodied intelligence, 3D visual grounding (3DVG) has been predominantly studied in indoor scenes with RGB-D or point-cloud inputs, while existing outdoor extensions largely re...
3D视觉定位(3DVG,通过自然语言文本在3D空间中找到对应物体)是具身智能的核心能力。传统研究局限于室内RGB-D相机,本文将其扩展至自动驾驶场景,提出Talk2Sensors框架,结合各类车载传感器(如雷达、相机)的物理特性,实现复杂室外场景的精准文本到物体的定位。
想象一下测试员可以直接对车喊话“去追前面那辆白色的货车”,而不是手写代码改跟踪ID。这种跨模态接口直接把智能驾驶的交互逻辑拉到了自然语言层面,做舱驾融合或者Robotaxi运营后台的可以关注。
Online HD map construction is critical to prediction and planning in autonomous driving. We find that existing physical attacks against online map construction are limited by a cross-boundary compensa...
在线高精地图实时构建是自动驾驶轨迹规划的前提。本文揭示现有地图构建网络存在一种跨边界补偿机制,会抵消单一对抗扰动。为此提出TwinIR物理攻击方法,通过协同生成两个隐形攻击点,成功让车载模型在构建地图时“忽略”真实的车道线或障碍物。
别以为只有纯视觉会被贴纸欺骗,在线建图模型一样存在被物理对抗样本攻击的风险。这给L3以上自动驾驶的安全合规敲了警钟:感知模型的对抗防御必须纳入强制的测试标准里。
High-quality driving data are essential for autonomous-driving systems and generative world models. However, rare and safety-critical scenarios involving adverse weather, braking under low tire--road ...
高质量的自动驾驶数据和世界模型离不开对恶劣天气和低附着路面(如湿滑、结冰导致轮胎打滑)的模拟。本文提出muSync-GS,利用3D高斯溅射(3DGS,一种快速渲染技术)合成符合严格物理时序同步和轮胎路面几何动力学的合成视频数据。
目前很多生成的视频数据在物理因果上是断裂的(比如在冰面上还能正常刹车)。3DGS结合物理动力学生成的视频,对于训练需要考虑车辆底盘极限的动力控制大模型非常有价值。
Vision-language models for autonomous driving primarily rely on cameras and LiDAR, leaving 4D radar largely unexplored as a standalone perceptual modality despite its robustness to adverse visibility ...
自动驾驶视觉语言模型通常依赖相机和激光雷达,而具备恶劣天气穿透性的4D毫米波雷达常被忽视。本文提出Radar4D-VLM,通过将雷达生成的候选目标区域输入冻结的(参数不更新的)大语言模型,验证了4D雷达作为独立感知输入在复杂环境下的推理潜力。
4D雷达比Lidar便宜且不怕雨雾,但在业界一直当辅助。这篇文章证明只喂雷达给VLM也能做逻辑推理,为主打“纯雷达+无图”的低成本视觉冗余方案提供了技术背书。
Camera-based bird's-eye-view (BEV) 3D detection typically assumes accurate and fixed camera extrinsics. In detectors using spatial cross-attention (SCA), extrinsic perturbations displace the image-pla...
基于相机的鸟瞰图(BEV)3D检测通常假设相机外参(相机相对于车辆的位置和角度)绝对准确。本文提出NCGR方法,解决空间交叉注意力(SCA)机制中因相机标定微小物理抖动导致的图像特征错位问题,提升感知系统在真实颠簸路况下的鲁棒性。
BEV感知最怕的就是震动导致的相机内外参变化,这篇工作直击量产痛点。它能大幅减少由于路面坑洼引起的幽灵刹车或漏检,做无图/轻高精地图方案的同学可以重点跟进。
3D object detection using light detection and ranging (LiDAR) sensors requires a balance between accuracy and computational efficiency for onboard perception in autonomous driving and robotic navigati...
使用激光雷达(LiDAR)进行3D目标检测需要平衡车载计算限制与准确性。本论文提出一种基于Mamba架构(一种线性复杂度的状态空间模型)的知识蒸馏方案,将大型高精度模型的感知能力压缩并转移至轻量级网络,满足自动驾驶与机器人导航的边缘侧实时计算需求。
用Mamba替代传统的Transformer做点云感知的蒸馏,推理耗时能随着点云数量的增加呈线性而非二次方增长,为低成本算力平台(如Orin甚至更弱的芯片)跑高精度Lidar感知提供了新解法。
This thesis addresses fundamental challenges in traffic scene prediction for autonomous driving by introducing robust and computationally efficient models based on polynomial representations. While co...
本论文解决自动驾驶中的长时距(数秒以上)交通轨迹与场景预测难题。通过引入基于多项式的数学表征模型,提出一种计算效率极高且鲁棒的预测架构,有效克服了传统时序模型在长时预测中容易出现的轨迹发散问题。
多项式拟合计算开销极小,比跑重型Transformer预测网络省太多算力。对于需要规划未来8-10秒变道超车场景的高速领航辅助(NOA)非常实用,且芯片端部署极其友好。
End-to-end driving requires a coherent understanding of future scenes, yet existing methods model these scenes using task-specific heads and output formats, with limited scalability. Can video generat...
端到端自动驾驶需要连贯地预测和理解未来场景。现有方法多使用为特定任务定制的网络输出头,扩展性差。本文提出SUV,将未来场景的理解统一建模为“视频生成”任务,通过生成的未来视频提取特征反哺规划模块,大幅提升了模型在复杂工况下的泛化扩展能力。
用生成的未来视频作为中间表征,顺理成章地把Sora那套视频生成技术降维打击到了自动驾驶规划上。这解决的是多任务统一架构的问题,以后加新感知任务只需改最后读视频的解析头。
Realistic weather translation is valuable for developing and evaluating autonomous driving systems, yet collecting paired videos of the same scenes under different weather conditions at scale is impra...
针对自动驾驶仿真系统中难以大规模采集同一场景不同天气数据的问题,本文提出RealWeather模型。利用驾驶世界模型(学习真实物理规律并生成未来视频的生成模型)生成高度逼真且符合场景物理逻辑的恶劣天气(如雨雪雾)驾驶视频,用于扩充评测数据集。
以前的天气数据增强往往只是简单地叠加雨雾滤镜,物理逻辑是错的。结合世界模型生成的雨雪场景带有真实的反射和遮挡效果,能直接用来暴测现有感知模型的Corner Case(长尾边缘场景)。
Deploying vision-language models (VLMs) for safety-critical spatial reasoning on resource-constrained autonomous driving platforms requires both compact model size and reliable metric grounding. We pr...
在资源受限的自动驾驶平台上部署视觉语言模型(VLM)进行安全关键的空间推理,需要模型体积小且具备可靠的度量基础。本文提出 MoRAL 框架以解决该问题。
大模型上车肯定会带来幻觉问题,这对要求绝对安全的智驾是致命的。将 VLM 的逻辑推理与传感器(BEV)的精确绝对坐标绑定,是解决自动驾驶幻觉的必经之路。
Forecasting future states from video sequences is a critical challenge for autonomous robotic systems and a fundamental objective of world modeling. Prior generative methods operating at the pixel lev...
从视频序列中预测未来状态是自主机器人的核心挑战。以往基于像素生成的方法计算成本高昂,本文提出一种无解码器的特征预测方案以提升效率。
丢掉沉重的 Decoder 来直接预测特征,是对抗端到端模型高延迟的绝佳工程优化。这种架构创新极有可能成为下一代车规级芯片设计的参考方向。
Traffic police gestures are safety-critical perception cues for autonomous driving. A deployable recognizer must infer commands causally from continuous full-frame video, remain stable around transiti...
交警手势是自动驾驶关键的安全感知线索。可部署的识别器必须能从连续的全画幅视频中因果推断命令,并在过渡阶段保持稳定。本文提出了一种针对中国交警手势的识别网络。
国内路况的特色难点终于被学术界重点关注了。解决了交警手势识别,城区高阶智驾面对修路路段和复杂路口的接管率就能显著下降。
Existing rainfall simulation methods for autonomous driving remain limited in physical controllability and multi-view consistency. This paper presents GSRAIN, a high-/low-frequency rainfall synthesis ...
现有的自动驾驶降雨模拟方法在物理可控性和多视角一致性上存在局限。本文提出的 GSRAIN 利用 3D 高斯溅射技术实现了物理真实的降雨场景合成。
高质量的 Corner Case 仿真测试数据是智驾迭代的核心资产。3DGS 结合天气物理引擎,大幅降低了构建极端雨天测试集的标注和采集成本。
The deployment of Vision-Language Models (VLMs) in autonomous driving (AD) systems is constrained by on-board computing power, restricting vehicles to small VLMs (SVLMs) with limited perception and re...
车载算力限制了自动驾驶系统只能部署感知能力有限的小型视觉语言模型(SVLM)。本文提出车端小模型与路侧大模型协同推理的框架以打破算力瓶颈。
车端算力不够,就利用 5G 让路侧 RSU 帮忙算。这种‘云-边-端’协同模式是过渡期内极具商业落地价值的方案,也利好做 V2X 基础设施的企业。
End-to-end (E2E) autonomous driving algorithms require rigorous closed-loop validation in simulation environments offering high visual fidelity, strong interactivity, and real-time performance. Existi...
端到端自动驾驶算法需要在提供高保真度、强交互性和实时性能的仿真环境中进行严格的闭环验证。本文提出基于解耦的 3D 高斯溅射技术来构建测试场景。
端到端模型成了‘黑盒’,传统的仿真测试体系直接失效。3DGS 这种重建快、可编辑性强的技术,正迅速取代 NeRF 成为自动驾驶仿真的新基建。
Recent Vision-Language-Action (VLA) models for autonomous driving (AD) increasingly utilize chain-of-thought (CoT) supervision to enhance the reasoning capabilities of their Vision-Language Model (VLM...
近期自动驾驶视觉-语言-动作(VLA)模型越来越多地利用思维链来增强推理能力。本文提出延迟暴露未来轨迹的方法,以确保模型的推理过程可被验证。
VLM 容易‘一本正经地胡说八道’。强制要求模型先走逻辑推理过程再输出轨迹,能把大模型不可控的思维过程变成白盒,这对功能安全团队来说至关重要。
Recent Vision-Language-Action (VLA) models for autonomous driving (AD) increasingly utilize chain-of-thought (CoT) supervision to enhance the reasoning capabilities of their Vision-Language Model (VLM...
近期自动驾驶中的视觉-语言-动作模型(VLA)引入思维链(CoT,让模型一步步输出思考过程)来提升推理能力。本文针对模型在输出推理过程时可能提前“泄露”最终轨迹坐标的问题,提出延迟暴露机制,确保模型是真正基于环境理解进行规划,而非简单模仿坐标格式。
VLM在智驾里有时会出现“强行编理由解释错误动作”的幻觉,这项工作通过强制解耦逻辑推理和坐标生成,提升了端到端模型决策的可解释性和安全性验证的可行性。
Autonomous driving (AD) systems have advanced rapidly over the past decade; however, robust perception under adverse weather conditions remains a major challenge, particularly in dense fog. In this wo...
过去十年自动驾驶系统发展迅速,但在恶劣天气条件下的鲁棒感知仍是一大挑战,特别是在浓雾中。本文通过多类雾密度建模来提升视觉感知能力。
纯视觉方案在雨雪雾天容易致盲。与其死磕更高分辨率的摄像头,不如在算法层面建立雾气浓度物理模型,这是摆脱对昂贵激光雷达依赖的低成本解法。
Vision-language models (VLMs) are emerging as a key component of embodied intelligence, with growing applications in auto-labeling and end-to-end autonomous driving. However, existing approaches for i...
视觉语言模型(VLM)正成为具身智能的关键组件。本文提出 STAR-VLM,利用毫米波雷达作为监督信号,提升 VLM 在自动驾驶中估计运动和速度的能力。
单靠摄像头测速误差太大,雷达数据又难以解读。让雷达监督大模型学习动态目标的物理特性,补齐了纯视觉 VLM 在高速场景下测速不准的短板。
High-definition (HD) maps are essential for autonomous driving systems. In constructing such maps, onboard multi-view camera images, standard-definition maps and satellite images provide crucial infor...
高精图对自动驾驶系统至关重要。本文提出一种在线建图方法,利用车载多视角图像、标清地图和卫星图像等信息,模仿人类驾驶员的行为进行实时高精图构建。
‘重感知,轻地图’已经是行业共识。实现在线实时构建车道拓扑,意味着车企彻底摆脱高昂的高精图采集和鲜度维护成本,城区 NOA 开城速度将大幅加快。
Modern autonomous-driving fleets record far more video than human reviewers can inspect. This motivates the need for an automatic clip triage mechanism, to surface rare and review-worthy clips, so tha...
现代自动驾驶车队记录的视频远超人工审查能力。本文探讨了利用 JEPA(联合嵌入预测架构)自动筛选罕见且有价值的驾驶视频片段的局限性。
依靠人工跑长尾数据早就跑不通了。这篇论文点出了用生成式模型挖掘数据时的坑,做数据闭环系统的工程师应警惕此类数据筛选盲区,避免漏掉高危 Corner Case。
End-to-end autonomous driving (E2E AD) systems integrate perception, prediction, and planning into a single differentiable architecture. While these models show great promise, their standard training ...
端到端自动驾驶系统将感知、预测和规划集成在单个可微架构中。针对标准训练方法的不足,本文提出一种特权概率潜在监督方法以提升规划效果。
传统的端到端模型容易学到局部最优解。在训练阶段给规划模块‘开上帝视角’(特权信息),是加速模型收敛并减少复杂路口急刹现象的有效手段。
Evaluating Multi-Agent Reinforcement Learning (MARL) policies in autonomous driving fundamentally relies on extrinsic statistical indicators (e.g., reward curves and success rates), which often mask i...
在自动驾驶中评估多智能体强化学习(MARL)策略主要依赖于外在统计指标(如奖励曲线和成功率),这往往掩盖了实际策略的质量缺陷。本文提出了一种新的评估度量框架。
仿真测试里 99% 的通过率可能掩盖了剩下 1% 的致命加塞动作。强化学习工程师需要这种看透内在本质的指标,否则真车上路极易遇到不可控的博弈死锁。
Vision-Language-Action (VLA) models have emerged as a prominent paradigm for end-to-end autonomous driving; however, their efficient deployment is severely constrained by high computational latency an...
视觉-语言-动作(VLA)模型已成为端到端自动驾驶的重要范式,但其高效部署受到高计算延迟和内存占用的严重制约。本文提出一种蒸馏方法以提升部署效率。
VLA 模型上车最大的拦路虎就是延迟。将自回归模型的推理能力蒸馏到扩散模型中,是缓解车端算力焦虑、平衡性能与速度的极佳思路。
We consider First-Order Logic (FOL)-based semantic communication for neuro-symbolic decision-making in collaborative environments such as autonomous driving networks. Each connected autonomous vehicle...
本文研究在自动驾驶网络等协同环境中,基于一阶逻辑(FOL)的语义通信,以实现车与车之间的神经符号协同决策。
V2X 单纯传原始数据太费带宽,传‘语义’和‘逻辑’才是正道。用符号逻辑进行车际通信,可能是解决路口盲区和拥堵博弈问题的突破口。
Trajectory prediction of surrounding agents is a prerequisite for safe planning and decision making in autonomous driving. Without high-definition (HD) maps, sensor-derived bird's-eye-view (BEV) featu...
周围目标的轨迹预测是自动驾驶安全规划的先决条件。在没有高精图的情况下,仅靠传感器派生的鸟瞰图(BEV)特征进行预测极具挑战,本文提出一种物理引导的解决方案。
‘脱高精图’是国内车企今年内卷的核心卖点。在无图环境下靠物理规律和场景交互来预测鬼探头等长尾行为,直接决定了无图城区智驾的安全性上限。
Uber has partnered with — and in some cases made direct investments in — about 30 autonomous vehicle companies over the past two years. Here's the list and the latest on the partnerships.
过去两年中,Uber 已经与大约 30 家自动驾驶公司合作,并在部分情况下进行了直接投资。本文列出了合作名单和最新进展。
Uber 用轻资产+结盟的方式化解了当初自动驾驶带来的生存危机。对创业公司而言,抱紧 Uber 这个大腿是目前比单纯卖技术更现实的现金流获取方式。
Cooperative perception (CP) enables connected autonomous vehicles (CAVs) to share complementary observations for safer navigation, but practical deployment is limited by bandwidth constraints, unrelia...
协同感知(CP)使联网自动驾驶车辆能够共享互补的观察结果,以实现更安全的导航。其实际部署受限于带宽等约束。本文提出利用大模型辅助形成联盟以优化通信。
V2V 直连如果广播所有数据会撑爆网络带宽。让大模型充当‘交警’来撮合有价值的数据共享联盟,是解决城市密集路口通信拥堵的有效方案。
World models and generative simulators are emerging as interactive testing infrastructure for autonomous driving because they can react to the ego planner and produce counterfactual, rare, and safety-...
世界模型和生成式模拟器正成为自动驾驶的交互式测试基础设施,因为它们能对自我规划器做出反应并产生反事实、罕见和安全攸关的场景。本文探讨了这类测试的充分性度量。
生成式仿真器虽然能自动造出海量Corner Case,但系统该怎么判定测试足够了?缺少充分性评估的仿真就是耍流氓,这篇文章为仿真平台的质量保证提供了一个硬核评估标尺。
Vision-language models (VLMs) have recently emerged as a promising paradigm for end-to-end autonomous driving, enabling agents to map multimodal inputs and high-level navigation instructions directly ...
视觉语言模型(VLM,将图像和文本映射到联合特征空间的模型)在端到端自动驾驶中展现出巨大潜力,能够直接结合多模态输入与高级导航指令。本论文提出一种单遍处理的无分类器引导方法,通过潜在质心引导提升模型对复杂驾驶指令的对齐与执行效率。
这种单遍处理机制省去了传统无分类器引导对模型推理两次的算力要求,如果泛化效果不错,可以直接降低量产智驾系统中引入大模型带来的延迟成本。
Driving style refers to the behavioral preferences that drivers maintain during driving, shaped by their diverse experiences, habits, and needs, and is typically reflected in varying levels of aggress...
驾驶风格反映了驾驶员在驾驶过程中的行为偏好。本文提出一种方法,旨在让自动驾驶系统生成符合乘客个性化需求(如激进或保守)的驾驶动作。
打通产品商业化的最后一公里是‘千人千面’。只懂安全驾驶的 AI 是不够的,能根据乘车人偏好动态调整驾驶激进程度的算法,将直接决定 Robotaxi 的复购率。
End-to-end (E2E) autonomous driving aims to learn a direct mapping from visual observations to control actions. However, these E2E models often act as black boxes and struggle with complex scenarios. ...
端到端自动驾驶旨在学习从视觉观察到控制动作的直接映射。本文提出一种师生框架,以解决端到端模型作为黑盒在复杂场景下推理能力不足的问题。
纯端到端黑盒模型在解决长尾场景时极其脆弱,引入大模型推理和知识蒸馏是目前行业的主流共识。这为算力受限的车端模型部署提供了一条折中路径。
Existing autonomous-driving world models typically perform dense prediction of future videos, occupancy states, BEV representations, or agent motion. We argue that planning need not reconstruct the co...
现有自动驾驶世界模型通常对未来视频、占据状态或智能体运动进行密集预测。本文认为规划无需重建完整的像素细节,提出了一种基于意图的潜在空间预测模型。
与其耗费算力去生成高清的未来视频,不如直接在潜在空间预测下一步动作。放弃生成像素级别的细节是提升车端实时推理速度的关键解法。
Understanding automated vehicles (AVs) is crucial to improving their acceptance. Numerous approaches to visualizing relevant traffic information to passengers have been proposed and empirically evalua...
了解自动驾驶对于提高其接受度至关重要。目前已提出多种向乘客可视化相关交通信息的方法,并进行了实证评估。
乘客不敢坐无人车,很多时候是因为不知道车在想什么。这项研究为座舱内的 HMI(人机交互)设计提供了实证参考,做座舱产品的同学可以多关注此类视觉反馈机制以降低用户的信任门槛。
Automated vehicles promise to improve accessibility and access to personal mobility for everyone. However, their design and current research trends in visualizing relevant information do not reflect t...
自动驾驶有望改善所有人的无障碍出行能力。然而,目前的信息可视化设计趋势并未充分反映视障人群的需求。
这是一条容易被忽视的受众需求。随着 Robotaxi 普及,视障群体的独立出行需求将被释放,车内非视觉交互(如空间音频、触觉反馈)将成为座舱设计的一个增量市场。
The temporary exemption from federal safety standards will let Amazon’s Zoox launch a real, paid robotaxi service in Las Vegas.
联邦安全标准的临时豁免,使得亚马逊旗下的 Zoox 能够在拉斯维加斯推出真正的付费无人驾驶出租车服务。
拿掉方向盘意味着真正的无人驾驶商业化闭环开始跑通,Robotaxi 行业正从研发测试期跨向商业变现期,这对 Waymo 等竞品会形成直接的营收压力。