Research KB 登录
清除
类型 Paper 108 Benchmark 4 Dataset 2 Code 4 Formalization 68 Claim 29 Evidence 38 Concept 33 Conflict 1 Verification 19 Synthesis 3 Disambiguation 4 Index 1 Figure 2 Example 1 Lifecycle extracted formalized reconciled Epistemic n/a partially-supported supported unverified 4 命中
BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)非反应式规划仿真基准,两代口径:v1 = PDMS(NC/DAC 门控 × TTC/EP/Comfort 加权,navtest 标准测试集);v2 = 两阶段 pseudo-simulation + EPDMS(新增 DDC/TLC 罚项与 LK/EC 软成本,navhard_two_stage split)。v1/v2 分数不可比。 Benchmark extracted n/a
BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”“闭环规划基准(nuPlan 模拟器):三 split × NR/R 两模式、0–100 平均分;reactive 语义依赖模拟器邻车重演实现——G2DP 与 Diffusion Planner 两源的主承重基准,跨源比较须逐 split 逐模式核对。” Benchmark extracted n/a
BMK-004 ImageNet class-conditional generation (256×256 / 512×512)类条件图像生成基准(ImageNet 256/512):主指标 FID-50K @250 DDPM 步、ADM TF 评估套件;DiT/LDM 口径差异在 decoder 选择(ft-MSE/ft-EMA vs LDM 原始)与 guidance 口径——CLM-009/012 的承重锚点。 Benchmark extracted n/a
BMK-005 CelebA-HQ unconditional generation (256×256)无条件人脸生成基准(CelebA-HQ 256²):LDM 报 FID 5.11 新 SOTA 并以 Precision/Recall 支撑 mode-covering 论证(CLM-020 承重锚点);单数据集、与 ImageNet 类条件口径不可混读。 Benchmark extracted n/a