真实跑出的(脱敏)样例,逐题原始输出与代码全部公开——包括负结果与被推翻的假设,照实报。
预注册假设一个被推翻、一个反向成立:大 batch 下 AWQ 无吞吐收益;量化伤指令跟随,不伤数学推理。逐题原始输出 + 代码 + 统计全部公开。
查看全套物料 →从一篇 2025 年的前沿论文出发做解耦:只保留最近 4 步,每步正确率 35.0% → 66.8%,衰减完全消失,且优于"把历史全部改正确"的上限条件。含我们自己第一版度量出错的完整记录。
查看全套物料 →在同一公开 4D-MRI、同一 K=3 运动模型和同一观测预算下,正交与平行双切片的三维重建误差几乎打平;预注册机制假设被推翻。含 5 个实验臂、3 个种子、27 个配对样本及完整代码日志。
查看全套物料 →7 份公开蛋白组、3 个实验臂、3 个种子;core 类翻转率 17.2%,并未比外围类别更稳。公开版按额外匿名要求隐去物种与基因专名。
查看案例 →12 张公开切片、4 个实验臂、3 个种子;平滑带来 +0.141 ARI,但 0.348 未过预注册绝对阈值,几何免费分假设被关闭。
查看案例 →查新与实验计划案例:用同掩码控制臂隔离“稀疏语义”和“真正少算”;尚未运行,不声称 GPU 或端到端 LLM 加速。
查看案例 →查新与实验计划案例:把“没有标签”拆成无目标变量、弱标签和少量独立真值三种情况;实验尚未运行。
查看案例 →CMU-MOSI 官方划分、2 个臂、3 个种子;训练期整模态丢弃把鲁棒性 AUC 从 0.649 提到 0.683,完整模态性能未受损,预注册预测被证实。
查看案例 →合成序列 6 个臂、3 个种子;长 indel 档上 2-piece 只比 1-piece 高 0.68pp 且种子符号不一致,未过预注册的 2pp 线,运行时间和内存却分别涨到 1.7 倍和 2.7 倍。
查看案例 →CIFAR-10、6 个臂、3 个种子、纯 CPU 234 秒;相同迭代数下平坦极值攻击只领先 3.29pp,没到预注册的 5pp 前提线,因此「同算力预算下还剩多少优势」这一问本轮答不了。
查看案例 →FinnGen R13、10 个表型、8 个臂、3 个种子;合并表型与类风湿锚点的方向一致性 0.463(经验 p=0.796),预测前提未成立,部位特异性在现有样本量下答不了。
查看案例 →CTD + STRING v12.0 + Enrichr,4 个臂、3 个种子、零模型各 1000 次抽样;两种随机对照复现「核心靶点」的频率都在 0.94–0.97,海马自己的经验 p 值 0.478 / 0.403 落在随机分布中间,特异性检验未通过。
查看案例 →CTD + STRING v12.0,3 个臂、3 个种子、3 档置信度、各 1000 次置换;核心靶点在留出卒中基因上的 AUROC 0.629,与随机化合物零分布 0.606 未拉开差距。
查看案例 →更多样例陆续发布 / More anonymised cases coming: evidence maps, novelty checks, experiment plans, traceable evidence packs — including negative results.