Skip to content

Latest commit

 

History

History
113 lines (110 loc) · 112 KB

File metadata and controls

113 lines (110 loc) · 112 KB

CHANGELOG — factor-cuda

变更记录(2026-07-31 自 PLAN.md 修改记录迁移)。每次实质变更登记:日期 | 模型型号 | 变更内容。

日期 模型型号 变更内容
2026-08-10 DeepSeek-V4-Flash (via Claude Code CLI) 发布 v1.1.1(patch:测试/证据增强)——selfcheck 遮挡缺口补强 + corpus_parity 全列(见下条)+ README badge + 相关项目链接修正(ashare-mcp→CharmYue 原项目、ml-quant-trading→initial-d 原项目,原链接含 fork/404);fc __version__ 1.1.1 + CITATION.cff + 三语 README 版本同步;无 API/kernel/契约变更
2026-08-10 DeepSeek-V4-Flash (via Claude Code CLI) selfcheck 遮挡缺口补强 + corpus_parity 全列(覆盖盘点 4 缺口闭合)——① poc3_stock_corr_selfcheck.cu 新增棋盘交错遮挡/整列全 False mask/masked-out 极端值域校验 3 用例;② poc3_rolling_ic_selfcheck.cu 新增常量行 GPU→NaN 用例(闭合唯一 test+bench 双缺失分支);③ corpus_parity_v1.py stock_corr 默认改全列 5000(流式比较避免 12.5M 对物化,--n-sub 降级保留但 gate 保持 false),回环 gate_closed=True:general 12,502,500 对全 PASS max_dr=6.66e-16、fallback_count=10318/12.5M(0.08%,全列揭示前缀 0.27% 之外的真实触发率);三份改动经 Codex CLI 直修 + 本地编译 ALL PASS + compute-sanitizer 0 errors 验证。来源:selfcheck 遮挡形态构造参考 QuantGplearn 面板缺失/遮挡形态(reviews/qg_reference_analysis.md 借鉴项 2——通用 patchiness 构造方法,非 QG 专属设计,QG 仅作对照候选非工程依赖)
2026-08-10 DeepSeek-V4-Flash (via Claude Code CLI) README 三语补充技术栈 badge(CUDA 13.3 + Python 3.12+)——主 README 已有 5 个 badge,按 QG 参考分析补充 2 个 shields.io 技术 badge;CUDA 用 support_matrix.json build_tested 单一真源值(13.3,非 QG 的 Optional——FC 是 CUDA-first 必需构建);顺带修复三语 badge 漂移:英文/繁体 README 原本无 badge 块,现与主 README 对齐(语言 badge 各用各语言)
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) FUTURE_WORK.md 未来修改方向 + 双审查闭环(commits b997bfa→70e600d→bae5c95)——方向文档(按依据×价值/成本分层,含优化/性能/功能/工程/限制/决策建议)+ 三语 README 索引;内部 Workflow 17 findings(2 BLOCKER)+ 外部 GPT-5.6-Sol 13 条(1 BLOCKER)全处置:+238% 过期依据重写、N=22600 高估修正、143<184 数学修正、12.6 GiB 跨口径分栏、新增 §2.4 设备驻留零拷贝等;外部额外抓出内部漏掉的 143<184/跨口径/零拷贝遗漏;项目价值评估(工具 C+/方法论 A-)沉淀 PROJECT_ASSESSMENT.md(gitignored)
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) 发布 v1.1.0(P3 适配层自动缓存)——三语 README 版本/测试数字/功能配套/证据索引同步 + CITATION.cff version 1.1.0 + GitHub release tag v1.1.0;fc 包 __version__ 1.1.0
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) [P3] 适配层自动缓存——外部 GPT-5.6-Sol 盲查 5 findings 处置(commits 9f26012+6c1dccf):MAJOR-1 workspace 句柄 GC 后 device buffer 泄漏→绑定层 class_ 改 std::unique_ptr<T, CustomDeleter> holder(析构前 clear)+ GC 释放测试;MINOR-2 bitwise 门改 view(uint32/64) 位模式比较(equal_nan=True 掩盖 NaN payload)+ output_sha256 绑定双边位模式;MINOR-3 _validate 从 raw timings 重算中位数/speedup(伪造派生字段拒绝);MINOR-4 provenance git_head 健康 gate(git 不可解析不写 closure OK);MINOR-5 _get 在 _guard 内重查 _enabled。测试 24 个 + pytest 150 passed/3 skipped 无回归;证据 clean HEAD(9f26012)重跑 rolling_ic 1.35x / cs_rank 1.20x(位模式位级一致+复用,closure OK,provenance pin)。双审查闭环完成(内部 6 + 外部 5,0 BLOCKER)。响应 reviews/gpt56sol_p3_ws_cache_review_response_2026-08-08.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) [P3] 适配层自动缓存(commits 8d1f299+8a78019+9e8c23f+7f652f9)——绑定层 cs_rank_f32/rolling_ic_f64/parameter_scan_f32 加可选 workspace 参数(默认 None 保持现行为)+ pybind11 CsRankWorkspace/RollingIcWorkspace 句柄(init + clear);fc _WorkspaceCache 透明形状 key 缓存(key=(T,N),每 key 一把锁串行化 C++ 非线程安全 workspace,_get 在 _guard 内 acquire 防 clear 竞态,factory 失败 fail-safe 回落无缓存,fc.clear_workspaces() 释放并恢复);三 op 接入 + fc 包版本 1.1.0。内部 Workflow 4 维度对抗审查(14 agents/1.15M tokens/12min)6 findings 处置(0 BLOCKER):clear 恢复 enabled/测量健康 gate/判语范围限定/disclosure 修正/测试卫生;2 refuted。测试 tests/test_ws_cache_v1.py 21 个(缓存vs非缓存位级一致/复用/形状切换/clear/并发/绑定句柄/7 合成负例)+ 全量 147 passed/3 skipped 无回归。证据 benchmarks/ws_py_cache_v1.py fail-closed(bitwise/cache_reused/测量健康/方向/1.2x gate + provenance/capture_sha256/原子写),clean HEAD 实测 rolling_ic 1.41x / cs_rank 1.25x 超 1.2x 阈值
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) 正式发布:v1.0.0(squash 单 root-commit eb18719)+ v1.0.1(与当前 main 对齐,含 8 commits 发布增强)——GitHub 仓库 redamancy231-create/factor-cuda public;三语 README(交叉链接/badge/Mermaid)+ MIT LICENSE + 社区健康文件(CONTRIBUTING/CODE_OF_CONDUCT/SECURITY/SUPPORT/Issue+PR 模板)+ CI(CPU/契约臂 75 passed)+ Description/Topics(11 个)+ 双后端 PII 零残留 + NRR links VERIFY-AT-PUBLISH 完成(URL 全 200)
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) 发布准备:清理 + README 双语 + NRR Pages 确认——发布清理(f23d9fd):backends.py QuantGplearn 路径改 FACTOR_CUDA_QG_REPO 环境变量 + pathlib 相对探测(零硬编码绝对路径)、CLAUDE.md 去外部仓库绝对路径前缀(标注本地开发锚点);README 状态更新为 PoC ①-④ 全闭合 + 内存三件套实测闭合 + NRR-2026-024 登记、竞品路径清理、双语 README.en.md(1443494);negative-results-registry Pages 线上确认 24 条(NRR-2026-024 上线;cancel 37h 卡死 waiting run + gh api pages/builds 触发);NRR links VERIFY-AT-PUBLISH 待 factor-cuda 发布后确认
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) PoC④ 加速比提升:rolling_ic/parameter_scan workspace 缓存(commit 1a1bb2d + 审查修复 05187b6)——parameter_scan 复用 cs_rank_workspace(buffer 集一致,ws 参数默认 nullptr);rolling_ic 独立 rolling_ic_workspace(~20 buffer + AllocRollingIcWorkspace + clear,懒 mask 容量,CUB temp acquire 时 query+分配);形状/设备/tracker key 匹配复用失配重分配;selfcheck 加 ws 位级测试(各 7 cases)ALL PASS;perf 稳态测:rolling_ic 48.98→33.0ms(1.46-1.48×)、parameter_scan 35.90→29.13ms(1.18-1.23×)均 BEATS gate。内部 Workflow 审查 8 findings 处置(commit 05187b6,1 BLOCKER):BLOCKER parameter_scan ws 路径 CUB temp 逐调用重分配+泄漏(query+alloc 未按 ws==nullptr 门控,镜像 rolling_ic stage2a 修复)——移植适配点实证;MINOR ws+MemTracker no-leak 验证(2 selfcheck)+ rolling_ic shape-switch 后 masked 用例;INFO perf ws 段内存回检 + .cuh ABI 声明(仅源码兼容)。pytest 126 无回归
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) 支持矩阵定义(commit 39d7c87)——docs/support_matrix.json 单一真源(CUDA 13.3 实测/声明 13.2+、MSVC 19.51、Python 3.12.7、compute capability 8.9 单架构、CMake+Ninja C++20;诚实标注非多架构);CLAUDE.md:214 与 README 依赖行改为引用矩阵不再重复硬编码版本列表
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) factor_corr streaming(项②) 输入/转置流式化 + HWM 实测闭合(commit 6a56f1a)——factor_corr_gpu_stream 逐 sub-chunk 上传 d_F_chunk + range 转置(d_F 全量不常驻)+ 延续 chunks + 单次全 R Kahan(决策 A);transpose_preprocess_range 逐元素独立位级同生产;selfcheck 位级 cases(tt 4096/160000/5000、null-mask、F128、short-R kb=1、负控 -2/-3/-5/-6/-7/-8/-9/-10/-11)ALL PASS;新证据生产者 benchmarks/factor_stream_hwm_v1.py(fail-closed 链 12 合成负例全拒);memory_budget streaming_factor_peak 加 d_F_chunk+d_pp1/2、load_stream_measured() fail-closed 摄入、streaming(项②) 列闭合为实测(F128 driver 7079.75 MiB fits vs 模型 6863.6,delta +216 未独立归因、物理余量 26.25 MiB 双口径披露;F12 锚点 636/1270 MiB delta≤2)——current 12.6 GiB 超预算 → streaming 6.9 GiB fits(模型-实测 vs measured-vs-measured 双口径诚实标注);内部 Workflow 审查 11 findings 处置闭合(commit 45a42cc,1 MAJOR 双口径余量披露 + 9 MINOR + 1 INFO);外部 GPT-5.6-Sol 审查 12 findings 处置闭合(commit 7c22bbb+95c4913,1 BLOCKER + 5 MAJOR + 4 MINOR + 2 INFO,裁决 REJECT→修复后双审查闭环)——F-01 BLOCKER 分配下界(driver≥0.5×model 拒伪造)、F-02 loader provenance 校验(source=live + git_head==当前,旧/回放证据拒)、F-03 production 强制非 fit、F-04 原子写+异常删旧、F-05 R 上界 -11、F-06 total/fb 物理校验、F-07 d_F_chunk 截断、F-08 cudaFree error、F-09 parser 加固、F-10 GUARD K>0;6 合成负例全拒;live clean-tree 重跑(95c4913,git_head=7c22bbb);关键运行发现:F128 streaming 物理余量薄(~26-166 MiB 波动),GPU 并发占用时可能 vram-exhausted;顺带修 _build_poc3.ps1 %PATH% 超长截断致 cl.exe 丢失
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) factor fblock 移植外部审查(GPT-5.6-Sol via Codex)11 条处置闭合(commit 60e4790,4 MAJOR + 7 MINOR,裁决不通过——伪造/异常证据仍可形成 closure_status=OK)——M1 ingest fits=peak≤AVAILABLE AND margin>8 MiB(vram-exhausted/伪造-margin 永不标 fit,闭合耗尽锚点);M2 parse_fblc 白名单字段校验(|fits=1 伪造字段计入 malformed,factor+stock 双修);M3 per-case driver_peak≤fb/samples>0 校验覆盖 production + producer 加 driver_peak≤fb gate;M4 free_before 头缺失拒绝(不再留 closure=OK 崩溃 JSON);M5 GUARD 唯一性;M6 证据重新生成;M7 disclosure 全动态派生(fb 计数+block=32 真假);M8 JSON 数值须真整数(rc=0.5 拒);M9 非 dict root/guard/OverflowError 干净拒绝;M10 provenance 加 git_dirty;M11 generated_at 带时区。顺带暴露真实数据异常:原 committed 证据 production driver_peak=fb+1(1-byte 物理不可能)→ 新校验暴露 → 重跑 --hwm-f128 后 production driver=fb(干净)、block=32 6588.11 MiB fits。验证 T1-T10 全 PASS(缺 free_before/重复 GUARD/伪造 fits 字段/production driver>fb/block=32 margin=0/rc=0.5/非 dict/guard 非 dict/健康)+ memory_budget all_match + pytest 126 passed。响应 reviews/gpt56sol_factor_fblock_port_review_response_2026-08-08.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) factor fblock 移植内部审查处置闭合(commit 4459aab):Workflow 4 维度对抗审查(19 agents/1.5M tokens/22min)15 findings 全 CONFIRMED 0 证伪(3 MAJOR + 5 MINOR + 7 INFO)——F1/MAJOR ingest 对 vram-exhausted block=64 重算 fits=True(与 docstring+producer 矛盾,closure gate fail-open)→ fits=peak≤AVAILABLE AND NOT vram_exh(vram 永不为 fit);FACTOR-1/MAJOR parse_fblc 不校验 kind→缺 kind 的 FBLC 抛 KeyError crash(exit 1)绕过 return-3+删旧——stock 侧共享此 bug(stock 双审查漏),factor+stock 双修; FACTOR-2/MAJOR vram_exhausted 豁免无界(伪造 margin≤8 掩码穿透)→ 豁免限定 model 也预测非 fit;FACTOR-3/MINOR producer 加 neither-fits-nor-vram 异常拒绝;F2/SEM-2/MINOR disclosure 硬编码 stale block=32(6529 vs 6571)+"6 fb"实为 7→ 动态派生;FACTOR-6/MINOR ingest 加 samples>0;F4/INFO docstring"6 fblock+1 production"。验证:T1-T3 producer(healthy/缺 kind/伪造异常)全对 + T4-T7 ingest(block=64 vram fits=False/anchor fits/伪造 vram 掩码拒/samples=0 拒/健康接受)全 PASS + memory_budget all_match + pytest 126 passed。移植适配点审查实证:F1/FACTOR-1 都是"我认为正确实际有误"的适配——独立审查确认值得做;共享 bug 横向传播:kind 缺失在 stock 双审查也漏,移植到 factor 审查才暴露,修 factor 时同步修 stock。响应 reviews/workflow_factor_fblock_port_review_response_2026-08-08.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) factor fblock HWM 证据 measurement_disclosure(commit 0c3d379,与 stock 外部 F1/contract 对称):factor_fblock_hwm_v1.py payload 加 measurement_disclosure——free-memory 采样粒度驱动/时刻相关(本证据 6 fb 全 7106 MiB、6/7 driver_peak 为 MiB 整数倍,但 block=32 非整数(6529→6571.22 MiB),小 delta 携带采样粒度误差不精确归因)+ render_md 披露行;reps 校验按 case 预期修复(F=12 交叉锚点 reps=2,F=128 blocks/production reps=1——严格 reps==1 误拒 F=12 锚点,producer validation + load_fblock_measured ingest 双同步);重跑 factor 证据(live --hwm-f128:block=32 driver 6571.22 MiB fits,WDDM 低余量运行期 delta 波动已知现象;guard pass=1/r1=r2=0;provenance source=live+git_head+exe_sha256);memory_budget measured_fblock 更新(6571.22/6325.11/delta 246.12)。memory_budget all_match + pytest 126 passed
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) factor fblock HWM fail-closed 深度修复同步(commit 34334a3,闭合外部 SC-1/SC-8 指出的共享缺口):stock N-blocking HWM 审查确认 factor fblock 先例(load_fblock_measured + factor_fblock_hwm_v1.py)共享同一 fail-closed 深度缺口——把 stock 侧双审查验证的修复移植到 factor 侧:load_fblock_measured 重写(完整字段集含 rc 必存在/精确 case 集 7 fblock+production/len 检查/driver_peak≤fb 物理校验/全部派生字段从原始 bytes+当前模型+AVAILABLE_BYTES 重算,JSON 派生从不信任;vram_exhausted(block=64/production)仍为合法非 fit;既非 fits 又非 vram 拒绝)+ factor 场景 measured_fblock 仅当 anchor 重算 fits 才闭合;factor_fblock_hwm_v1.py(parse_fblc malformed 计数/guard 校验 r1==r2==0/--from 缺参+读异常+超时失效旧产物/case count 重复检查/reps==1/unexpected 写盘前 gate——closure_status OK 仅当无预期-fit 失败/provenance 加 source+git_head+exe_sha256)。验证:factor 8 合成负例全拒(guard r1=-7/malformed/重复/reps=0/伪造超预算/缺 rc/缺 case)+ 真实 2026-08-07 factor 证据重算 anchor 6529.09/True/6325.11 + memory_budget all_match + pytest 126 passed。共享 fail-closed 缺口已在 stock 侧(e9ae54e)和 factor 侧(34334a3)双闭合
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr N-blocking HWM 外部审查(GPT-5.6-Sol via Codex)17 条处置闭合(commit e9ae54e,2 BLOCKER + 4 MAJOR + 6 MINOR + 5 INFO,基于 HEAD 60c8bf9)——外部抓出内部修复仍遗漏的 fail-closed 深度缺口:BLOCKER-1 ingest 重写(完整字段集含 rc 必存在 + 精确 case 集含 production + reps==1 + driver_peak>0 + malformed 干净拒绝);BLOCKER-2 ingest 从原始 driver_peak bytes 对照当前模型 + AVAILABLE_BYTES 重算全部派生字段(JSON 派生字段从不信任;重算超预算拒绝整个证据);MAJOR-3 producer closure_status 仅当全 case pass(rc=0 超预算/显存耗尽拒绝 + 删旧产物);MAJOR-4 parse_guard 校验 r1==r2==0 + malformed 计数拒绝;MAJOR-5 --from/setup 异常路径删旧产物;MAJOR-6 provenance 加 git_head + exe_sha256 绑定来源;MINOR-7 source 用 is_from;MINOR-8/9 docstring 口径统一(host ~8.4 GB / delta 未独立归因);MINOR-10 GUARD 扩展 fast+masked 双路径;MINOR-11 reps==1 校验;MINOR-12 ingest 干净拒绝。综合 fail-closed 测试 8 合成负例全拒(guard r1=-7/malformed/重复/reps=0/伪造超预算/缺 rc/缺 case)+ 健康 ingest 重算 anchor 22.0/True/16.9/5.1。selfcheck ALL PASS + pytest 126 passed(一次 DLPack stream 偶发失败重跑绿)。双审查闭环完成(内部 20 项 + 外部 17 项,逐层补漏 fail-closed 深度)。响应 reviews/gpt56sol_stock_nblock_hwm_review_response_2026-08-08.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr N-blocking HWM 内部审查处置闭合(commit 336966b):Workflow 4 维度对抗审查(24 agents/1.9M tokens/18min)20 findings 全 CONFIRMED 0 证伪(1 MAJOR + 9 MINOR + 10 INFO)——SC-1 MAJOR:per-case rc!=0 不拒绝证据(anchor OOM 时 producer 仍写 closure_status OK + ingest 盲信;与 factor fblock 先例共享此缺口)→ producer validation 加 per-case rc==0 + 失败路径删旧产物 + ingest 加 rc==0 && fits gate(合成负例实测拒绝);SC-4/STOCK_NBLOCK_HWM-1 production 对照 with_mask=True vs 实测 nullptr → model_peak 改 with_mask=False,delta +3.07→+8.87(落入校准 7-11 MiB 范围);SC-2 driver_peak>0 校验;SC-3 失败删旧产物;F5 case-count 检查;SC-6/F6 --from source 标记 + 信任边界注释;F1/F4 审查口径行矛盾修正(N-blocking 已实测闭合);F2 model-closure note 加 N≥2block 限定;F1 contract + F3 MiB 量化披露 + delta 归因降级;F7 host 披露 4 GiB→8.4 GB(两个 NN buffer);F3 contract .cu 注释修正(无 stock probe)。验证:合成负例 rc=-7 拒绝 + 旧产物删除、证据重生成(production delta +8.87)、memory_budget 重跑矛盾消除、selfcheck ALL PASS + pytest 126 passed 无回归。响应 reviews/workflow_stock_nblock_hwm_review_response_2026-08-08.md;外部盲查 prompt 已备 prompts/gpt56sol_stock_nblock_hwm_review_prompt.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) [P1] stock_corr N-blocking HWM 实测闭合(commit ca57d7e,memory_budget M3 nblock 列 model_prediction→measured):poc3_stock_corr_selfcheck.cu 加 --hwm 模式(逐 case 后台 cudaMemGetInfo sampler + fb 快照 + sample-count 健康握手;N=5000 block 阶梯 {256,128,64,32} + production N=5000 对照 + 位级 GUARD load-bearing 退出 2;FBLC| 记录)+ 新证据生产者 benchmarks/stock_nblock_hwm_v1.py(fail-closed:exe rc/GUARD pass=1/完整 case 集/fb>0/samples>0 否则 exit 3 不写产物 + closure_status OK + capture_sha256;两层判据 fit/显存耗尽/OOM)。关键事实:nblock device 峰值 N 无关(N≥2block 时 max_cols=2block,tile 缓冲按 max_cols 非 N)→ N=5000 实测锚定 N=22600 闭合;N=22600 实际运行未实测(host O(N²) 输出 ~4 GiB + O(N²·T) 计算,诚实披露)。实测(RTX 4060):nblock block=256 driver 22.0 MiB(模型 16.9,delta +5.1 MiB = cudaMalloc 驱动开销,与 production ~3 MiB 同量级)、block 128/64/32=14.0/6.0/2.0 MiB 阶梯、production N=5000 530.0 MiB(模型 526.93,delta +3.07 与校准 driver overhead 一致);全部 fits(margin ~7.1 GiB),GUARD pass=1。memory_budget_v1 load_stock_nblock_measured() fail-closed 摄入 + nblock 列闭合为实测 + note 披露 N=22600 host 成本。selfcheck 默认 ALL PASS + pytest 126 passed 无回归
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr N-blocking 外部审查(GPT-5.6-Sol via Codex,27m27s)13 条处置闭合(commit 9c29063,0 BLOCKER/0 MAJOR/7 MINOR/6 INFO,裁决通过):外部基于 commit 0ec3a0b(滞后内部 9d7c4ce 一 commit),MINOR-1/3/4/7(d_fb_count 漏计/对角 NaN/错误码/错误测试)已由内部处置先行修复;本次修复:MINOR-2 max_cols clamp min(N, 2*block_width)(block_width=N 退化时 2N 线性 +(2N)² d_corr_tile ≈16.5 GiB 超分配 → clamp 后 ~4.4 GiB;memory_budget 模型同步)、MINOR-6 文档化 PoC bad_alloc/raw-device 泄漏限制、INFO-8 注释对角格写两次同值(非对角每格恰一次)。确认 9 项:重构等价(brace-delimited body 比较,仅 two_pass_centered 加 forceinline)/safe_pearson guard 完整/[B
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr N-blocking 内部审查处置闭合(commit 9d7c4ce):Workflow 4 维度对抗审查(bitwise-correctness/evidence-f4/memory-streaming/contract-errors,24 agents/1.86M tokens/19min,逐 finding 独立对抗验证)20 findings 全 CONFIRMED / 0 证伪——修复:①移除 d_fb_count 死管道(F1-dfb-count-dead:分配/清零/传入 fallback_kernel 但从不 D2H 读回,改传 nullptr;memory_budget 模型同步移除条目,M4-1/F1/F2-model 一并闭合);②对角 NaN 改 NAN 宏与生产 writeback 同源(F2:硬编码 0x7ff8… 在 CUDA 13.3 CUDART_NAN=0xfff8…(负号 quiet)非 canonical 工具链下位级断言会静默失效);③补 nblock -4 域 / -3 N*N cap / determinism 测试(SC-ERR-1/SC-ERR-4:-4 host pass-1 分支此前零覆盖、determinism 未断言);④docstring 文档化错误码契约(-6/-7)+ block_width=1 大 N ~N²/2 tiles 挂起警告(SC-ERR-2/SC-ERR-5);⑤memory_budget note 披露 host pass-1 O(T*N) 预扫描成本权衡(M4-2:device 驻留换 host 预扫描)。接受/确认:F3(forceinline bit-neutral)/F4(host int vs device double count 等价)/F5(非对角 ~2-4× 计算浪费 harness 固有)/Q1-Q5(F4 干净/重构等价/单定义/对称/fallback 语义)/M4-3(无全量 device buffer/tile 容量/输出完整性)/SC-ERR-3(cleanup 错误 PoC 简化)。验证:selfcheck ALL PASS(15 nblock case 位级+mirror+CPU 锚+-4/-3/determinism)+ memory_budget calibration all_match=True(N22600 nblock 16.9 MiB 保持)+ pytest 126 passed/3 skipped 无回归。响应 reviews/workflow_stock_nblock_review_response_2026-08-08.md;外部盲查 prompt 已备 prompts/gpt56sol_stock_nblock_review_prompt.md
2026-08-08 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr N-blocking 独立实现(commit 0ec3a0b):重构 src/stock_corr.cu 7 kernel 移入 namespace stock_corr_impl(新 src/stock_corr_impl.cuh 共享声明/常量/ColStats/KahanAcc/safe_pearson/finalize_cell/two_pass_centered,防 F4 自参照;two_pass_centered 须 forceinline 防多 TU 重复符号)——重构等价验证(selfcheck ALL PASS + corpus parity gate_closed=True + calibration 11 例不变 + pytest 126 passed/3 skipped);stock_corr_gpu_nblock 独立 driver(pair 轴分块:下三角 tile (a,b) a≥b,对角=块内上三角含对角、非对角=[B
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) B32 运行期 delta 隔离验证按 GPT-5.6-Sol 审查降级(commit 0104cd6,裁决需修复→8 条全处置):M1 实验变量未完全隔离→改「同一路径低余量对照」撤回「唯一变量」;M2 H3 计算交互无法排除→撤回「H2/H3 排除」;M3 机制超遥测→降级「现象已验证/WDDM 机制未隔离」;M4 阈值扫描单样本/近似→标近似撤回单调;M5 stock_corr 外推不成立→撤回改「factor fblock 场景实测」;M6 证据链真源不自洽→同步 factor_fblock_hwm_v1.{py,json,md}+memory_budget_v1.md(重跑生成器防覆盖);m1 margin 口径拆分;i1 F=128 探针复制风险披露(记录不处置)。主证据 reviews/b32_delta_iso_verification_2026-08-07.md + 审查 reviews/gpt56sol_b32_delta_iso_review_2026-08-07.txt(均 gitignored)。pytest 126 passed / 3 skipped 无回归。同步记忆 methodology-wddm-overalloc-not-oom 降级措辞
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) [可选] B32 运行期 delta 隔离验证(commit bb03c8f):真实 fblock 判别实验(scratch/fblock_reprobe.cu + scratch/delta_iso_probe.cu,gitignored)——同一路径低余量对照(reps=2):block=8 高余量 delta +4.4 vs pad 压余量 ~780 → +222.6/+223.5;block=32 天然低余量 +204.8/+215.9;纯分配恒 ~+3-5。隔离探针分离「余量 vs 链大小 vs 计算」三变量;证据 reviews/b32_delta_iso_verification_2026-08-07.md(gitignored)。外部审查 prompt 已备 prompts/gpt56sol_b32_delta_iso_review_prompt.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) Phase 4 证据基于停牌 corpus 重跑 fresh(commits a4064c6+9a140eb):corpus_real_v1 41BB9EF4(含停牌标记);G1-G6 全过(parity gate=True / determinism=True / self-hash PASS);E2E F=12 committed 3.035× / fresh 2.940×(best-free=cupy),cross-run delta 3.13% 稳定,verdict PASS-partial(≥2× met,<5× → NRR-2026-024 保持);stale 标注解除(phase4_bench_v1.py CF7497 文案改为动态引用当前 corpus hash + 标注 2026-08-07 fresh 重跑已闭合,旧 2026-08-06 证据 superseded)
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) factor fblock HWM 外部审查(GPT-5.6-Sol via Codex,18m20s)7 条处置闭合(裁决需修复,无需 REDESIGN):F1 BLOCKER fail-closed 链——run_exe() 返回 rc、main 校验(exe rc==0 / GUARD 恰好 pass==1 / 7 case 完整唯一 / fb>0 / samples>0)不满足返回 3 且不写产物、payload closure_status:"OK"、load_fblock_measured() 下游复验 closure/guard/case-set;4 条合成负例全拒(删 GUARD / guard fail / 缺 case / samples=0 → exit 3);F2 MAJOR sampler 健康握手(FblkRunSampler 检查 cudaSetDevice + sample_count + 启动握手 + case 前后 cudaMemGetInfo 检查 + FBLC 加 samples=);F3 MAJOR OOM 优先 + vram_exhausted 显式含 rc==0;F4 MAJOR WDDM 机制归因降级为「与 WDDM 超分配/共享内存回退一致,机制未隔离验证」(adjudicate/render 4 处);F5 MINOR provenance(capture_sha256 + probe 复验边界披露);F6 MINOR fblock_factor_peak buffer 顺序按实现 cudaMalloc 链 + 统一 _tile 命名 + d_mask_tile 无条件 + 移除 with_mask 参数;F7 MINOR memory_budget 汇总标签(本次 delta + 历史 245.09 单样本未纳入证据)。验证:重跑实测 7 case samples 全 >0(2.2M–202M)、B32 driver 6529.09 MiB fits、pytest 126 passed / 3 skipped 无回归、selfcheck ALL PASS、校准 delta≈0。响应 reviews/gpt56sol_fblock_hwm_review_response_2026-08-07.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) [P0] factor 场景 F=128 fblock HWM 实测闭合 memory_budget_v1:poc3_factor_corr_selfcheck.cu 加 --hwm-f128 模式(run_hwm_f128:逐 case 独立 sampler + 逐 case fb、F=12 位级守卫 load-bearing(GUARD| 记录 + trigger 比较 + FAIL 时退出 2)、block {8,16,32,64}(block=1 省略:8256-tile host 循环 ~30min)、production F=128 显存耗尽实测);新 benchmarks/factor_fblock_hwm_v1.py(FBLC|/GUARD| 解析 + 两层判据:fit=driver_peak≤7676(无 64 MiB 带)、显存耗尽=margin≈0 非 OOM(WDDM 共享内存兜底)、OOM=rc≠0;exit 基于 model_fits);memory_budget_v1.py clamp 修正(max_pair_width=2*block 与实现一致)+ 报告块加 n_blocks>=2(排除退化 block=F)+ factor 场景 measured_fblock 闭合。实测(RTX 4060,free_before 7106):F=12 block=6 锚点 driver 1194/2386(模型 1190.63/2381.24,delta +3.4/+4.8)+ GUARD 位级 PASS;F=128 block=8/16/32 driver 1590/3170/6404.39(模型 1585.57/3165.38/6325.11,总 delta +4.4/+4.6/+79.29,fits 余量 1271.6);block=64 / production F=128 driver 7106 margin=0 显存耗尽非 OOM——WDDM 共享内存兜底 12.6 GiB(修正"超预算→OOM"假设);分配链 probe(scratch/alloc_probe.cu)实测 drop 6328 vs 模型 6325.11 delta +3(模型分配链精确,block=32 运行期 delta 归因假设为低 free 余量 WDDM 波动,reps=1 未隔离验证)。pytest 126 passed / 3 skipped 无回归 + selfcheck ALL PASS。Workflow 21 agents 对抗审查 18 候选 16 CONFIRMED 全处置(64 MiB 带死代码→删+docstring 统一、逐 case margin、guard load-bearing、model_fits exit、dpp 80B/lane、n_blocks→n_tiles、canonical 报告块 block=6、host staging 估算、归因假设化)。外部审查 prompt 已备 prompts/gpt56sol_fblock_hwm_review_prompt.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) real corpus 停牌标记 GPT-5.6-Sol 外部审查闭合(commit dd50332,裁决需修复,9.5min):9 项处置——F4 parse_close_volume 健壮化(strip/归一/nan-inf-空白-非法-负值保守)+ derive_halted 纯函数 + manifest rule 统一 <=0;F7 fetch→halted→build 接线端到端测试;F5 rolling_ic mask∩isfinite + min_valid 公共 API 测试(实现已正确,补执行证明);F6 factor_corr mask=False 但有限集成测试;F9 README 明确 0.15% real 经验值 vs 1.2% synth 压力基准;F2 phase4_bench_v1 caveat 补 Phase 4 证据 stale(CF7497→41BB9E,G4/parity 未重跑);F1 manifest universe_snapshot(requested_sha256 冻结锚 + 漂移风险);F3 mask_semantics 补 halted 事后识别审计;F8 记录(fwd 停牌窗口 NaN 已由既有测试覆盖)。pytest 121→126 passed / 3 skipped;npz hash 41BB9E 保持(parse 等价性确认)。响应 reviews/gpt56sol_corpus_halt_review_response_2026-08-07.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) f32 domain skip GPT-5.6-Sol 外部审查闭合(commit b4b1bf6,reviews/gpt56sol_f32_domain_review_2026-08-07.txt,裁决需修复,11min):10 项发现 6 通过+1 范围限制+3 需修复全处置——F9 性能归因修正(1.27s 跨 dtype 对照 → 同面板 commit 前后实测 OLD 2655ms → NEW 568ms = 净省 2.09 s/call(79%),消除 domain-check 全链);F8 测试补强(inf/NaN 面板 f32 vs f64 位级比较 + 全无效 mask 断言);F2 边界固化(±inf/-inf/NaN/全无效 mask);F1/F3 文案精确化(finite-nonzero 值域 / pybind11 入参转换阶段);F5/F7 已由 9d619a8 闭合(isfinite 归 kernel)。外部审查与内部 Workflow(16 agents)对数学正确性独立收敛;外部额外抓出 F9 归因不严谨。pytest 121 passed / 3 skipped。响应 reviews/gpt56sol_f32_domain_review_response_2026-08-07.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) real corpus 停牌标记审查处置闭合(commits c052737+16f7e9b):Workflow 3 维度对抗审查(21 agents/179 万 tokens,1 agent API 中断)确认发现全处置——① forward_returns §2.5 契约修复:入场/出场停牌窗口 fwd 置 NaN(防填价伪收益泄漏进 rolling_ic;实测泄漏=0,fwd finite 0.9950→0.9926);② 测试固化:tests/test_corpus_halt_v1.py 7 测试(mask 不 all-True 守卫 / fwd 入场+出场停牌 NaN / 中间日停牌不影响 / halted None 不变 / shape 校验 / parse_close_volume 边界);③ fetch 解析提取纯函数 parse_close_volume(可测);④ 文档漂移修复:README real 状态(未实现→已实现+停牌标记)、phase4_bench_v1.py caveat、manifest forward_returns_rule(含停牌条款);⑤ 证伪 HALT-1/3/4 等(factors 填价污染为固有设计非 bug)。npz 确定性 hash 41BB9EF4。pytest 114→121 passed / 3 skipped
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) f32 domain skip 审查处置闭合(commit 9d619a8):Workflow 3 维度对抗审查(16 agents / 128 万 tokens / 逐发现独立对抗验证)5 确认全处置 + 5 证伪——MAJOR×2(skip-removal 假绿→test_gpu_domain_check_skip_is_locked(monkeypatch 断言 f32 不 consult in_corr_domain / f64 必 consult);stock_corr 零覆盖→test_stock_corr_f32_skip_and_f64_out_of_domain)+ MINOR×2(f32 边界 FLT_MAX/min-subnormal/-0.0 固化于 f32 skip 测试;docstring「isfinite 池在 CUDA kernel 非 binding」措辞修正)+ INFO×1(fcad-1 正面确认无剩余 Python 侧 f32→f64 转换)。fcad-3(f64 路径 isfinite 冗余)记录不处置。pytest 112→114 passed / 3 skipped。响应 reviews/workflow_f32_domain_review_response_2026-08-07.md;外部审查 prompt 已备 prompts/gpt56sol_f32_domain_check_review_prompt.md
2026-08-07 DeepSeek-V4-Flash (via Claude Code CLI) 适配层 factor_corr/stock_corr f32→f64 upcast 优化(commit ef28de6):_gpu_domain_check 对 f32 输入跳过 domain check(f32 值域 [1.4e-45, 3.4e38] 严格含于 corr 域 [1e-150, 1e150] → max|x|/min|x| 守卫恒真,数学论证+实测),消除 Python 侧 f64 astype+isfinite+abs+min/max 链(单独 1.8s/call),upcast 留给绑定 forcecast 单次做(C++ 侧);f64 路径保持全量检查(零拷贝 view,行为不变)。验证:f32 cuda == f64 cuda 位级一致(f32→f64 upcast 精确);T=1218×5000×12 f32 面板整条 cuda 路径 OLD 2655ms → NEW 568ms = 净省 2.09 s/call(79%,同面板 commit 前后对照);f64 超域输入(1e151)仍抛 "数值域外" ValueError;pytest 111→112 passed(新增 test_factor_corr_f32_skips_domain_check 固化:f32==f64 位级 + f32 inf/nan 不抛 domain 错)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 4 benchmark + 双审查闭合(内部 Workflow 35-agent + GPT-5.6-Sol 13 发现,commits 8c16aa3→b68bfd20):benchmarks/phase4_bench_v1.py(G1-G6 fail-closed 非零退出 + gate provenance envelope + --fresh 复现;统一 E2E 估计量 ratio-of-medians;CUDA 子命令上下文覆盖;untimed warmup + 整块轮转;_canon_bytes dtype/shape framing;单算子 grade 改名 gpu-timing-precise/wide);证据 results/phase4_bench_v1.{json,md}——E2E F=12 2.895–3.035× PASS-partial,未达 ≥5× 目标 → NRR-2026-024(ratio-of-medians);单算子本轮 cs_rank 1.59×/parameter_scan 2.28×/rolling_ic 1.99×/factor_corr 13.15×/stock general 2.31–2.65×;跨会话方差披露(rolling_ic 1.99→6.94×,不声称"除 factor_corr 外全部 <5×");层差异披露(非因果);适配层 factor_corr +238%;ic_stack 0.72× 组件负结果;NRR-2026-024 数字对齐 evidence(F09/F10 修复,schema 0 错,三语一致)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) 三项 P1 审查处置闭合(GPT-5.6-Sol 17 项全修复,commit efd2bde):real corpus R1-R6——R1 build_corpus 补 dates/ids/price/h/lag/generator_version(13 键,subset_prefix 不再 KeyError);R2 write_corpus 对齐 manifest_schema_v1.json(family/shapes/arrays/generation/seeds/hash.algorithm/stats/labels/env);R3/R4 fetch 记录 script_sha256/accepted_ids(93)/rejected_ids(7)/query_time/selection_rule(code-asc);R5 mask_semantics 披露停牌填价+样本选择;R6 因子 momentum_1 正向命名 + vol_10 用 10 收益 as-of t。内存预算 M1-M6——M1 fblock 加 d_F_tile(B64 12.6 GiB 撤销 fit、B32 6325 MiB fit);M2 dpp 按 Partial1+Partial2=80B/lane(F128=161.25 MiB,原 5× 低估);M3 model_prediction 标注;M4 stock N=22600 输出 N² 分块标注;M5 n_tiles+候选块宽;M6 host staging。fblock F1-F5——F1 fblock-cpu-anchor(CPU 独立锚定);F2 fblock-b1/bF;F3 固定 NaN pattern + 修 ASCII 注释(GBK 吞换行破坏写回,根因实证);F4 fblock-shortR(kb=1);F5 结论限定。验证:8 cases 全 PASS + selfcheck EXIT=0 + pytest 111 无回归 + 预算校准 delta≈0 保持。审查抓到 3 处真实缺陷(fblock 漏 d_F_tile / dpp 5× 低估 / real loader 契约)——「验证未覆盖」盲区实证。响应 reviews/gpt56sol_phase23_p1_three_review_response_2026-08-06.md
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) real corpus 真摄入完成(baostock 真实 A 股,commit 2d59b68):benchmark_corpus/fetch_real_corpus_v1.py(baostock 管道:query_hs300_stocks 沪深 300 股票池 + query_history_k_data_plus 前复权 close 逐股下载 + 价格派生因子 momentum_5/reversal_1/vol_10 + build_corpus 摄入标准 corpus);corpus_real_v1 = 93 只沪深 300 成分股 × 1212 交易日(2020-2024),data_sha256=B8160DAE4FF73815...;端到端验证(corpus_loader load + sha256 校验 + fc.cross_sectional_rank/factor_corr/rolling_ic 消费真实数据全通,rank finite 112251/112716);试点(20 股×1 年)→ 扩展到 100 股×2020-2024;npz gitignore、manifest 提交为 provenance
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) 三项 P1:内存静态预算 + corr width 分块(factor F-blocking)+ real corpus 真摄入框架:① 内存静态预算(commit 5d35882)——benchmarks/memory_budget_v1.py 当前实现精确 live-byte 模型(5 操作分配链从源码提取),校准 5/5 delta≈0(factor 1190.63/2381.25、stock 526.93/1816.81 vs 校准 HWM);结论:factor F=128 当前 12.6 GiB 超预算 → 项②流式化/项③F-blocking 6.7 GiB fits(合法前沿必需)、stock N=22600 超预算 → N-blocking 触发点确认、canonical/N=10000 fits、d_pp F=128→32.2 MiB;闭合 Kahan 决策 v2 四项(d_valid 生命周期/transpose overlap/d_pp 规模/cross-block pair);实现细节建模 stock nn=N² + d_M 分配 8n。② corr width 分块(commit ba84e35)——factor_corr_gpu_fblock 最小证明(分 F 轴 tile:对角=块内对角 pairs、非对角=[block_b
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) GPT-5.6-Sol 审查 acceptance_v1 响应闭合(15 条全处置 → v2 六门全 PASS + unlock_phase4=True):审查(reviews/gpt56sol_phase23_acceptance_review_2026-08-06.txt,裁决需修复)15 条全处置(commits c891bdd+7f0ee95+23702fc)——B1 性能门进 overall(gate_2_perf:9 必需操作+尺寸全 BEATS 冻结 gate);B2 stock_corr general 改 fresh 验收(corpus 面板 fresh 测量对冻结 gate,不读重基线旧 evidence);B3 fail-closed(rc≠0/缺 median/gate→NOT_BEAT,general 超 gate→NOT_BEAT,rc 进 verdict);高4 stdout fail-open 修复(selfcheck 精确 "ALL PASS" 终态 / parity 完整 arm 集合 {numpy,cupy,gpu} / e2e 未匹配 verdict→FAIL);高5 stock median 逐行锚定解析(禁 DOTALL 跨行);高6 timeline 独立执行(6 passed/0 skipped/0 failed);高7 timeline 硬断言 h=5/lag=1;B8 evidence 引用真实 path+sha256(11 项可审计)+ unlock 要求 clean(排除 benchmarks/results 证据重写);高9 parity numpy/cpu 臂必达 + memory 门含 calibration rc + corr 可分块证据引用;高10 e2e JSON 结构化校验(verdict/corpus sha256/scope;两次 fresh 记 Phase 4 补充);高11 rebaseline 交替批次 + 两端数值 parity 断言(N=500 2.440×/N=2000 2.280× parity_ok=True);高12 gate 身份校验(run_id/schema/panel/corpus hash 冻结防移动靶);中13 over-claim 降级(fresh 标注 + clean 门 + rc 列);中14 synthetic 表述改「~6% non-finite」(非 ~18% invalid);中15 ≥2× 边界用 median <= exact_half。验证:acceptance_v1 v2 全量六门全 PASS(含 gate_2_perf),unlock_phase4=True(git clean),EXIT=0;perf 全 BEATS 含 fresh general 24.59/255.14ms;e2e F=12 3.04×;known_gaps 诚实记录(below_5x 五项 + synthetic-panel)。响应 reviews/gpt56sol_phase23_acceptance_review_response_2026-08-06.md
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 2-3 各操作验收门槛闭合(acceptance_v1 五门全 PASS,解锁 Phase 4 benchmark+NRR):docs/phase23_acceptance_spec_v1.md(Workflow 7 agent 多视角设计 + 魔鬼代言人挑战 + 合成定稿)——三处决定性纠正:① stock_corr general「0.42× FAIL」为跨面板类别错误(poc3_stock_corr_perf.cu general 用 make_panel 合成面板 ~18% 无效格 + 非连续分布,对照 corpus 面板 gate 违反 FAIR_BASELINE 同数据同 mask;同面板重基线实测 2.4× PASS)② 无未来函数 timeline fixture 零测试引用(BLOCKER)——rolling_ic_labels_v1.json 冻结但 grep 全仓库无测试执行 ③ gate_config_v1.json 冻结禁验收日重生成(只调 --check)。实现三项:timeline 集成测试 tests/test_timeline_no_lookahead_v1.py(6 测试:manifest hash 匹配/重跑生成逐元素一致/forward_returns[t]=price[t+1+h]/price[t+1]-1/尾部+停牌 NaN/fc.rolling_ic 消费行对齐独立 Spearman 抽查;pytest 105→111 passed);stock_corr general 同面板 gate benchmarks/rebaseline_stock_corr_general_gate_v1.py(corpus returns[:, :N]+mask 冻结面板对称 reps:N=500 GPU 25.6ms vs CuPy 61.8ms = 2.41×、N=2000 2.32× PASS,产出 runs/stock_corr_general_gate_20260806/{evidence,gate}.json,不改 gate_config_v1.json);统一验收编排器 benchmarks/acceptance_v1.py(thin orchestrator:子进程复用全部现有证据生产者不重写验证逻辑 + gate 从 JSON 复算不信任 exe 硬编码 BEATS(退出码恒 0)+ 逐操作五维判定 + acceptance_v1.{json,md} 双件 JSON 单一真源 MD 渲染)。验收结果:五门全 PASS(gate_2_semantics(6 selfcheck ALL PASS + pytest 111 passed/0 failed + corpus parity gate_closed + 四臂 parity numpy/cupy/gpu 27/27 + qg 15/27+12 N/A)∧ gate_2_memory(calibration all_pass + max HWM 2381 ≤ 7266−512 MiB)∧ gate_2_no_lookahead(timeline 测试)∧ gate_3_schema(G=4 字典序 + group_status)∧ gate_3_e2e(poc4 F=12 3.03× PASS));perf 全 BEATS(cs_rank 8.94/factor_corr 215.4/rolling_ic 46.9/parameter_scan 35.3ms + stock_corr fast 5.3/37.3/199.4ms + general 25.6/251.8ms)。已知缺口诚实记录(below_5x:cs_rank 3.12/parameter_scan 3.14/rolling_ic 3.29/general 2.41-2.32 标注 Phase 4/NRR below_5x_note;synthetic-panel general 非代表测量注明)。顺手修复:general 重基线 _median_ms 单位双乘 bug(samples 已 ms 又 ×1000 → 1000× 错误,speedup 因单位抵消仍正确);reference_files.md 陈旧 gate 数字订正(27.27/377.2/2452.6→26.35/359.35/2382.37)。复现:PYTHONIOENCODING=utf-8 python benchmarks/acceptance_v1.py
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) GPT-5.6-Sol 测试套件外部审查响应闭合(14 条全处置,套件 89→105 测试):裁决需修复,14 条逐条处置——#1/#2 门控闭合(隐藏组/active_groups/group_semantics 改 @NEED_CUDA;torch 测试补 @NEED_TORCH;新增 torch-missing smoke test_import_fc_works_without_torch);#3 F17 锁精确 27 case ID + npz sha256==manifest data_sha256 + test_frozen_manifest_full_execution(逐 case 数值/异常/schema 断言);#4 F07 同步以同流依赖 kernel + 文档覆盖(.cpu() 隐式同步结构限制);#5 corr_match 加 inf 分类/符号逐元素比较(堵假 PASS);#6 HG-2 高精度测试修正——原误调 stock_corr 改为真调 factor_corr((1,N,2) 面板)+ 增显式 stock/factor var-underflow;#7 T×N>INT32_MAX 与 4GiB 预算上限 @skip 显式记录(分配不可行);#8 fc/parameter_scan.py 硬化——非白名单 status 抛扫描级 RuntimeError(契约 §4)+ 新增 status-5 负例测试;#9 mask_must_match_device 重构消费 DLPack capsule 解析真实 device(CUDA capsule+CUDA values 不再误拒)+ 3 调用点更新;#11 新增手写 _independent_rank_panel 独立秩参考(rank/scan 不再同源 np_cs_rank);#12 DLPack 拒绝后重传 → consumed ValueError;#13 device 例外矩阵(异 device ValueError / corr cpu 例外合法 / rolling_ic 跨设备拷贝);#14 只读/独立分配参数化扩展(stock_corr/rolling_ic/factor_plane)。验证:pytest tests/ -q 105 passed / 3 skipped(2 不可行上限 + 1 多 GPU 门控);回归 fc smoke ALL PASS + parity 四臂 27/27 + ext 8/8。响应文件 reviews/gpt56sol_test_adapter_review_response_2026-08-06.md
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 2 验收测试套件 tests/test_adapter_v1.py(7 类 89 测试)+ 2 处真实 bug 修复:闭合 GPT-5.6-Sol Phase 1 计划审查(reviews/phase1_adapter_plan_review_gpt56sol_2026-08-06.txt)F01/F02/F05/F07/F10/F17/F18 七项处置,并经 19-agent Workflow 对抗审查(3 维度覆盖/强度/修复 + 逐发现验证,14 条 REAL)逐项加固——F01 6 签名快照含 kinds 断言;F02 严格标量(descending=1/0/1.0、min_valid=True/30.0/1、factor_plane f=True/1.0 全 ValueError);F05 factor_plane(mirror/no-sharing/requires_grad detach/F-contiguous 复制/f 越界);F07 同步边界(值敏感 entry-sync 非空洞、同流 kernel 返回同步、DLPack 非默认 stream + 单次消费 + f64/int32/float16/bool-mask dtype 回归);F10 correlation cpu+cuda 逐 pair 直连冻结 oracle + HG-2 归约敏感高精度测试(bias_1e12/bias_1e15/f64_ulp_bias + var-underflow 对串行 Kahan 参考 ≤1e-12,冻结 corpus 数组);F17 manifest 结构 + params 逐操作校验 + rolling_ic 数值 case 执行;F18 上限 + 隐藏组失败注入(9/701 参数化 + active_groups 传播断言)+ 只读/独立分配/位级稳定 + cs_rank 独立 oracle(np_cs_rank,非自参照)+ rolling_ic 独立参考 + parameter_scan 语义 + requires_grad + torch-CUDA + 零拷贝传输审计 + 多 GPU 门控。🐞 bug ①:fc/_util.py::_dtype_ok 旧实现用 numpy 白名单比较 from_dlpack 产物(torch.float32==np.float32 为 False)→ 合法 float32/64 DLPack 胶囊被误拒——加 torch dtype 分支 + torch 分支统一路由 _dtype_ok(F06 处置路径,smoke 从未测 DLPack)。🐞 bug ②(HG-2 契约违反):fc/_cpu_core.py::_two_pass_corr 用 numpy mean,1e15 偏置数据上 corr 偏离 Kahan 参考 ~9e-3(bias_1e15)/2.4e-7(f64_ulp_bias),违反 HG-2"所有后端与串行 Kahan ≤1e-12"——加 _bias_sensitive 守卫(
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) 绑定扩展重审响应闭合(GPT-5.6-Sol reviews/p1_binding_ext_review_gpt56sol_2026-08-06.txt,裁决需修复 6 项,Phase 1 全部闭合):F1 高 白名单 launch 失败分支加组末同步检查点(drain 前序成功 launch 的异步错误,sync 错误升级扫描级);F2 高 CUDA event API 全部返回码检查(create/record/elapsed/destroy,部分创建清理,事件失败→扫描级);F3 高 active 组隔离——mask 按 need_mask(仅 active 组含 masked 组 0/2 时校验/必填,all-unmasked 时 mask 完全忽略可 None)+ host 输出只分配 active 组(inactive h_out=nullptr)+ kernel h_out null 检查允许 inactive null + 预算按 active_count;F4 中 默认路径零时钟(t0/elapsed_diag 受 use_timing/return_timing 守卫);F5 中 计时起点排除 event record host 开销(t0 在 record 成功后取);F6 中 成功路径清理错误传播(FreeAllBuffers/event destroy 错误返回扫描级,非静默 0)。循环改 break 模式(goto fail 移循环外,消除 MSVC 转移跳过初始化)。验证:绑定扩展(default 无回归/timing>0/active 子集/unmasked-only mask 可选/masked-active mask 必填)+ fc smoke ALL PASS + parity gpu 27/27 + ext 8/8 无回归;smoke 增 2 用例
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 1 parity gpu 臂(F16)+ fc 域检查修复:parity_check_v1.py 加 GpuBackend(4 方法路由 fc)+ BACKENDS 条件注册(torch.cuda 可用时)+ run_backend gpu 分派 + ext checks gpu 分支(stock_corr correctness / GEMM 对抗 / corr diag boundary)+ _factor_corr_panel gpu。修复 fc 域检查真实 bug:_gpu_domain_check 未检查 in_corr_domain 返回值(域违例未抛 ValueError——parity gpu 2 个 error case FAIL,corr_underflow_domain/err_out_of_domain)。验证:parity all 四臂——numpy/cupy/gpu 均 27/27 + ext 8/8(gpu 与 numpy/cupy 完全一致,适配层 GPU 路径契约合规),qgplearn 15/27 + 12 N/A(既有能力映射)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 1 fc. 契约适配层实现*:fc/ 包(__init__.py + _util.py + _cpu_core.py + 4 op 模块)——6 冻结签名(cross_sectional_rank/factor_plane/factor_corr/stock_corr/rolling_ic/parameter_scan);容器 numpy/torch/DLPack(检测顺序 + PyCapsule 强化 F06);dtype/mask 门控(严格 bool,uint8→ValueError);同步协议(entry/return F07);域前置检查(适配层拥有,_exc_kw 子串);mask-device 匹配;严格标量(descending type is bool/min_valid 拒 bool F02);source-device 路由(F08);mask override(all-unmasked 忽略 F14);active-group 子集扫描(F11);schema 合成(spec/groups/summary + 逐组 timing F13/F15,elapsed 单一权威 F12)。smoke 全 PASS(rank 位级 + f64 downcast + 严格标量 / factor_plane no-sharing / factor_corr+stock_corr 双后端 1e-12 + 域违例 / rolling_ic cpu+auto-gpu / parameter_scan schema+subset+mask override+错误路径)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 1 F19 fc/_cpu_core.py 共享 CPU oracle 模块:从 benchmarks/backends.py AST 机械提取 np_cs_rank/np_factor_corr/np_stock_corr/np_rolling_ic/np_parameter_scan + in_corr_domain/_ordinal_rank_1d/_two_pass_corr/_masked_gemm_stats/gemm_cancel_mask/CANCEL_RATIO_THRESHOLD(单一真源,零漂移);backends.py 改同向依赖(from fc._cpu_core import ... + 根 sys.path,F19 评审处置——fc 不反向依赖 benchmark 层),cp/qg 段不变。验证:backends import 同对象 + parity numpy 臂 27/27 PASS + ext 8/8(零漂移门槛)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 1 绑定扩展(parameter_scan return_timing + active_groups):parameter_scan_gpu 加可选尾参 h_time_ms[4] double(wall-clock launch→D2H+sync,excludes 共享 H2D)+ h_time_gpu_ms[4] float(cudaEvent kernel-only,excludes D2H)+ h_active[4](跳过组不 launch/D2H/计时,status -100,白名单失败组 timing 0.0);parameter_scan_f32 加 return_timing=False/active_groups=None(默认零变化,dict 增 time_ms/time_gpu_ms + _elapsed_ms_diag 诊断——F12 elapsed_ms 单一权威保留给 fc 入口)。修 4 个实现 bug:① cudaEventRecord(ev_stop) 原在 cudaDeviceSynchronize 后致 time_gpu_ms≈0(改 launch 后 enqueue,stream 顺序随 kernel 完成);② time_gpu_ms 原用 std::vector<double> + reinterpret_cast<float*> 内存错位致全 0(改 std::vector<float>);③ 绑定 groups 构建把 -100 跳过组当非白名单抛 RuntimeError(改 None);④ goto fail 跳过 use_timing/ev 初始化编译错误(声明移函数顶)。验证:default 4 组位级 == np_parameter_scan 无回归 + timing>0 + active 子集(跳过组 -100/None/time 0)+ smoke 增 7 用例全 PASS。触碰审查闭合绑定(参数语义/timing),待 GPT-5.6-Sol 重审
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) Phase 1 plan 审查闭合 + HG-2 变更批准(进入 Phase 1-4 实施):GPT-5.6-Sol plan 审查(reviews/phase1_adapter_plan_review_gpt56sol_2026-08-06.txt,19 项含 4 阻断,裁决需修复)全处置 → plan v2(indexed-enchanting-breeze.md:绑定扩展含 active-group 选择性执行/同步协议/严格标量/oracle 直连/schema 冻结/白名单映射表/_cpu_core 共享模块);HG-2 变更(用户批准,reviews/hg2_phase1_limits_2026-08-06.md)写入 CLAUDE.md §0——① 实现维度上限冻结为契约条款(排序类 T*N≤INT32_MAX 且 N≤2^24 / stock_corr N*N≤INT32_MAX / factor_corr F≤128 / parameter_scan 4·T·N·4B≤4GiB,超出抛 ValueError 非静默实现帽);② 零拷贝适用范围澄清(零拷贝仅 host-resident 输入;torch-CUDA 经 D2H→H2D→D2H→H2D 语义正确非零拷贝,设备驻留留 Phase 4)。plan v2 确认 → Phase 1 适配层实施开始
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) 竞品检索 v3(P2 待办闭合):中文短词补检(gh api search/repositories 认证:因子截面/截面因子 42——多因子选股/因子挖掘非 GPU 截面分析;GPU 量化因子/GPU 因子/因子分析 GPU 全 0——中文 GitHub 无 GPU 因子截面分析;CUDA 量化 20——LLM/CUDA 模型量化多义词噪音)+ 补充英文词(GPU alpha factor→IIcodehub/GP-Alpha-Miner-GPU ★7 GPU 遗传规划因子挖掘 CuPy+DEAP;cross section factor python 13——CPU 截面回测)+ Web 全网中文(Spectre(Heerozh/spectre)★818 GPU 因子计算引擎+回测器 PyTorch 为最接近替代;AurumQ-RL A 股多因子+GPU 训练栈;drmysore/gpu-algorithmic-trading GPU 回测;arXiv 2507.07107 截面排序 GPU 化 51×;华泰金工 CuPy/cuDF 高频因子加速)。query manifest 存档 COMPETITOR_SEARCH_MANIFEST_v1.json(endpoint/query/认证/时间戳/结果数/相关命中/hash,14 GitHub + 2 Web queries,sha256 a25c08...);COMPETITOR_ANALYSIS.md §一 v3 结论 + §三 替代矩阵扩充(Spectre/GP-Alpha-Miner-GPU/AurumQ-RL/drmysore)。结论:仍未发现与「GPU 因子截面分析算子库」直接重合的开源项目;GPU 因子计算/挖掘/回测引擎生态活跃,Spectre 为最接近引擎级替代。v3.1 1 年活跃度核实(2026-08-06,gh api 实测 pushed_at):1 年内活跃的 GPU 因子相关项目(QuantGplearn 2026-06/AurumQ-RL 2026-07/equity-factor-lab 2026-07/GP-Alpha-Miner-GPU 2026-01/drmysore 2026-01 + CuPy/cuDF 持续)全为因子挖掘/引擎/回测生态位;无 1 年内活跃的契约级截面分析算子库;最接近的 Spectre(★818)2025-04 已停更 → 空白生态位仅对「契约级、可复现、市场无关截面分析算子库」定位成立,差异化落点=冻结 oracle/位级确定性/参数扫描
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) GPT-5.6-Sol PoC ④ 证据审查②响应闭合(reviews/poc4_e2e_review_gpt56sol_2026-08-06.txt,裁决需修复,无需 REDESIGN):F1 高 IC 堆叠未进端到端计时(预注册 amend 明列归并要素)→ 三臂内实际构造 np.stack((4F,T)) 并单列 per_op_s["ic_stack"](实测 GPU ~0.00015s 可忽略但已计入);F2 重复不对称(gpu 3/numpy 1/cupy 2)+ stock_corr 单次 → 统一对称 reps=3(中位数+min/max+逐样本记录;stock_corr 3 reps);F3 _best_free 非严格白名单 + qg 无执行臂 → 改严格基线白名单 {numpy,cupy,qg}(断言至少一基线)+ qg 可用性检测/执行臂/结果字段同源(qg_arm 仅 qgplearn 可导入时注册;未装→不注册→诚实记录);F4 日期硬编码 → 改运行时 ISO 时间戳 + git HEAD + 命令行 + corpus data_sha256 证据封装(禁硬编码日期,时差统一 2026-08-06)。表述修正:factor_corr 12.29× 精确为「完整实现臂 vs CuPy 参考臂」;GO 范围限定最小参数扫描流水(stock_corr 支路 <2× 独立诚实报告);趋势「随 F 扩展持平/近稳」非显著增长;保留「达门槛未达 5× 优线」。修复后 fresh rerun(对称 reps=3 含 IC 堆叠):F=12 主口径 2.97× PASS(GPU 4.432s [4.431,4.463] vs best=cupy 13.17s;F=4/8 = 2.82×/2.97×;逐算子 parameter_scan 2.69×/rolling_ic 2.07×/factor_corr 12.29×/ic_stack 1.09×;stock_corr N500 1.96×/N2000 1.99×)。证据 benchmarks/results/poc4_e2e_v1.{json,md} 已更新(evidence 字段)
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) GPT-5.6-Sol 绑定审查①响应闭合(reviews/poc4_binding_review_gpt56sol_2026-08-06.txt,裁决需修复 1 MAJOR + 2 MINOR,六聚焦角度全通过 + bool mask 修复确认正确):MAJOR m.def 未注册 Python 默认参数(cs_rank/rolling_ic/stock_corr 省略可选参数直接 TypeError)→ 补 py::arg("mask")=py::none()/descending=false/min_valid=30/return_ranks=false/return_stats=false;顺带修出 factor_corr_pybind 同问题(py::arg("mask")=py::none()——smoke 显式传 mask 掩盖,审查未覆盖该文件);MINOR-1 模块 docstring 零拷贝描述精确化(匹配 dtype/layout 输入才零拷贝借用;转换分配副本持有至调用返回);MINOR-2 factor_corr 注释/文档 mask 统一 bool/uint8。smoke 增 5 例省略可选参数回归(cs_rank omit==explicit / omit descending / rolling_ic omit / stock_corr omit / factor_corr mask 缺省)。修复后两 smoke ALL PASS
2026-08-06 DeepSeek-V4-Flash (via Claude Code CLI) PoC ④ 四 kernel pybind11 绑定 + 端到端 PASS + factor_corr bool mask 悬垂 bug 修复:① src/factor_cuda_pybind.cpp(cs_rank_f32 / rolling_ic_f64 / stock_corr_f64 / parameter_scan_f32,GPU-only 低层绑定)——设计经 Workflow 3 角度对抗审查 26 项全处置(reviews/poc4_pybind_binding_design_2026-08-05.md);dtype 门控(cs_rank/parameter_scan 严格 f32、mask bool/uint8 白名单、非数组 TypeError)、GIL release、错误映射(负契约码→ValueError / 正 cudaError→RuntimeError / parameter_scan 白名单降级→None)、py::arg 计数。smoke 36 项 ALL PASS(rank 位级含 NaN payload / rolling_ic 1e-12 + return_ranks / stock_corr fast+general dispatch / parameter_scan 4 组位级 + mask 必填)。② factor_corr bool mask 悬垂指针 bug 修复(审查闭合代码的真实 bug):factor_corr_pybind.cpp mask cast 持有器在 if 块内析构 → bool→uint8 forcecast 新数组释放 → GPU 读悬垂(uint8 零拷贝共享侥幸正确掩盖);修复为函数作用域持有器;smoke 增 bool vs uint8 交叉断言。③ PoC ④ 端到端 PASS:benchmarks/poc4_e2e_v1.py 最小参数扫描流水(逐因子 parameter_scan → rolling_ic → factor_corr + stock_corr 支路 N=500/2000)三臂(GPU/numpy/cupy)测量——F=12 主口径端到端 2.93×(GPU 4.44s vs best=cupy 13.03s,≥2× PASS,未达 5× 优线);逐算子:parameter_scan 2.65× / rolling_ic 2.06× / factor_corr 12.04× / stock_corr 1.90-1.99×;证据 benchmarks/results/poc4_e2e_v1.{json,md}。④ PLAN.md:140 PoC④ 行 amend(F/T 分块要素由最小证明①②闭合,端到端流水用非分块路径;判据不变)。⑤ 修复脚本 2 处 bug(_best_free 误含 gpu 臂 / per_op_best 误含 gpu 臂)
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) F/T 最小证明② GPT-5.6-Sol 独立审查响应闭合(Codex 用户跑,裁决 GO 0 BLOCKER + 2🟡 全处置,commit 983412e):F-01 run_factor_chunk_case 加 expected_K 硬断言(从 chunked trigger bitset 数 K,漂移即 FAIL;7 用例设值 main-shape=12/null-mask=17/K=0=0/short-R 1·1·0/trigger=5/adversarial=5;负控=-1)防 Kahan 分支覆盖同步漂移;F-02 重构「相对 5f9fe1e 机械等价」实际执行重演(scratch/reconstruct_check/ git show 旧版 + 双编译 -I 区分 + 3 形状 fc/b S1/S2/S3 IDENTICAL)+ factor_corr_impl.cuh 头部标注三证据源。修复后 selfcheck ALL PASS + sanitizer 0 errors
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) pybind11 factor_corr 绑定层(commit 372d512):新增 src/factor_corr_pybind.cpp(factor_corr_f64(F3, mask=None) -> (F,F)——F3 (T,N,F) f64 c_style|forcecast 自动 upcast f32、T/N/F 从 shape、gil_scoped_release 包 factor_corr_gpu、非零 rc→runtime_error);CMake BUILD_PYBIND11 option(默认 OFF 不扰既有 target)+ find_package(CUDAToolkit) include(CXX 源需显式 CUDA include)。smoke 测试 ALL PASS(None/mask 路径 1e-12 + f32 upcast + 确定性 + 3 错误路径 ValueError)。不碰审查材料
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) F/T 最小证明② factor_corr continuation 位级断言(关闭 corr「可分块(延续正确性)」判据,commit d13b403):新增 src/factor_corr_impl.cuh(ABI Partial1/2/K1/K2 static_assert + 内联累加算子 accum_p1/2_cell + 固定树归约 tree_reduce_p1/2_store,生产与延续 kernel 编译期绑定同一逻辑防 F4 自参照);src/factor_corr.cu kernel 定义移出匿名 ns 至文件作用域 + reduce_p1/p2 循环体/树归约改调共享函数(forceinline 机械等价)+ factor_corr_gpu 加可选第 8 参 h_trigger_out(D2H trigger bitset);selfcheck 新增延续 kernel(reduce_p1/2_cont:d_pp[pair*256+tid] 双字段延续 + first 初始化 + lane 全局索引 + finalize_pX_from_pp 树归约推迟)+ factor_corr_gpu_chunked driver(chunk 预校验 int64/非末尾 256 倍数 return -9)+ 8 用例「corr 全 P 项 + trigger bitset」位级 PASS + CPU 双锚定 + 负控(fresh-start 差异=延续 load-bearing / bad-chunk 拒绝=块纪律强制)+ Kahan 单次全 R launch 保持(决策 v2 证明对象)。selfcheck ALL PASS + sanitizer 0 errors + corpus parity gate_closed=True + calibration 11 例无回归
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) F/T 最小证明① GPT-5.6-Sol 独立审查响应闭合(Codex 用户跑,裁决需修复 2🟠+2🟡 无 BLOCKER):F1 rolling_ic_gpu 加可选 h_rank_f_out/h_rank_r_out(scatter 后 D2H)+ rolling_ic_gpu_chunked 同加 + run_chunk_case 对 rank_f/rank_r 做 ref-vs-chunked 位级断言(3 正用例「IC+ranks」双位级,闭合 CUB 段重切黑盒——补最终 IC 非单射缺口);F2 负控(break_offsets_side 界内错位 offsets,实测 broken≠full 证实重切负载承担,compute-sanitizer 仍 0 errors);F3 分配前 int64 预校验 chunks(每项 c>=1/-7、前缀<=T/-8、总==T/-6;修 {T+1,-1} 绕过 sum==T + c<1 泄漏);F4 proof_panel 补 -0.0 生成 + null-mask + min-valid 边界(29/30/31/32 有效)用例。修复后 selfcheck ALL PASS + sanitizer 0 + dev-build EXIT=0
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) F/T 最小证明① rolling_ic chunked-vs-non-chunked 位级断言(关闭 rank 类「可分块」判据 + CUB 段重切黑盒):新增 src/rolling_ic_impl.cuh(preprocess/scatter/pearson 3 生产 kernel 外部声明);src/rolling_ic.cu 3 kernel 定义从匿名 ns 移至文件作用域(体逐字节不变——脚本比对 HEAD IDENTICAL,rolling_ic_gpu API 不变);poc/poc3_rolling_ic_selfcheck.cu 新增 rolling_ic_gpu_chunked(chunk-local 缓冲 cap=max_chunkN ≠ TN + CUB 段偏移每 chunk 重切本地 0 基 + base pointer 切片 + 逐 chunk D2H + 执行证据打印防 F4 自参照)+ 3 用例(main T=1218/N=5000 chunks[512,512,194] / stress N=250000 chunks[4,3] / extreme 32×[1])全 位级 PASS(uint64 含 NaN payload)+ main-shape CPU 1e-12 信息性 + compute-sanitizer 0 errors + dev-build/calibration 无回归。修复 driver bug:D2H 字节数改 c*sizeof(double)(原误 c*N*8 拷 20.5MB 进 9.7KB h_out)。审查:Workflow 3 角度对抗审查(evidence-F4/correctness/contract,后台)+ Codex prompt 已备 prompts/gpt56sol_ft_minproof1_review_prompt.md
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) cs_rank workspace 审查响应闭合(GPT-5.6-Sol,reviews/poc3_cs_rank_workspace_review_response_gpt56sol_2026-08-05.md):9 项发现全处置——F01 device 入缓存键(失配重分配);F02 d_mask 改懒分配可选容量(顺带修出 mask-off 陈旧 mask 位真 bug);F03 CUB q==0→q=1 守卫(双路径);F04 selfcheck 加直接 double-clear;F05 加陈旧缓冲自愈测试(全阶段故障注入缓办);F06 禁拷贝;F07 阻塞 owner_tracker 绑定(clear 用 owner + tracker 变化入键);F08 perf 加 legacy 非 ws 中位数 + cold p50/p95;F09 阻塞 7 参 overload 保旧二进制 ABI(专用链接测试实证:旧头 7 参 TU + 新库链接运行 OK)。修复后 selfcheck ALL PASS + sanitizer 0 + mem_tracker/parameter_scan 无回归 + perf 9.25ms BEATS gate 无回归
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) cs_rank workspace 分配缓存优化(P0-②,性能 BEATS gate):stage 探针实测端到端 16.37ms 中**分配开销 ~7.7ms(48%)**为最大瓶颈(cudaMalloc×8+CUB temp+cudaFree×8;pinned 仅省 ~0.2ms/方向)→ cs_rank_workspace 显式分配缓存 API(新增 .cuh 结构 + cs_rank_workspace_clear + cs_rank_gpu 第 8 可选参):形状 key(T*N/N/mask 存在性)匹配→复用、失配→清空重分配,CUB temp 一次性 query+缓存;非 ws 路径保持原每次分配/释放;失败路径 ws 清空+key 重置、运行期失败缓冲保留可重试。selfcheck 新增 13 例 workspace 路径(ws vs 非 ws 逐位一致 + 形状切换 + mask 开关 + clear 复用 + 错误后可用)ALL PASS + sanitizer 0 + mem_tracker/parameter_scan 无回归。性能 steady-state median 9.17ms BEATS gate 13.926ms(原 16.37 未达标;cold 首调 18.1ms 含分配诚实报告;波动 ±0.6ms)
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) factor_corr F1 审查响应闭合(GPT-5.6-Sol,reviews/poc3_factor_corr_f1_diag_review_response_gpt56sol_2026-08-05.md):🟠 修复 backends.py::_two_pass_corr 乘积型分母 sqrt(sxx*syy) 在正次正规方差(S>0 且 S*S 下溢)上把有限自相关错判 NaN——改顺序除法 (sxy/sqrt(sxx))/sqrt(syy)(同 safe_pearson/np.corrcoef)+ 正值与 isfinite 守卫,四处对角同步残余缺口一并闭合;🟡 修复 parity ext 新增 ext_corr_diag_boundary(5 类边界列 × stock/factor × np/cp 对冻结 oracle 对角断言)。修复后 numpy/cupy 全 PASS(manifest 27/27 + ext 8/8),qgplearn 仅既有已知偏离
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) factor_corr 对角 var 下溢修复(review F1 同步):writeback_kernel 对角从盲判 count>=2 && min!=max → 1.0 改为读计算路径值 d_corr[p] + isfinite → 1.0/NaN(tiny-adjacent [1e-150, nextafter] 中心化平方下溢→oracle NaN,原 GPU 错返 1.0);CPU 参考同步 poc/poc3_factor_corr_selfcheck.cu(对角改 cpu_pair_corr(xi,xi) isfinite→1.0/NaN)+ benchmarks/backends.py 4 处对角同步(np/cp factor_corr + np/cp stock_corr——后者是 stock_corr v2 F1 修复 1b122de 漏掉的配套同步);selfcheck 新增 5 例 F1 对角回归(tiny_adjacent/non-degenerate/constant/count<2 N=1/two-factor mixed,golden 断言 GPU+CPU 参考都匹配)。修复后 selfcheck ALL PASS + compute-sanitizer 0 errors + parity_check_v1 69 PASS/0 FAIL + np/cp 参考正常面板逐位一致
2026-08-05 GPT-5.6-Sol (via Codex CLI) + DeepSeek-V4-Flash stock_corr v2 异后端审查修复闭合(F1-F7 全处置)+ HG-2 契约修订:独立审查(0 BLOCKER/4 MAJOR/3 MINOR,本机复现全部确认)——F2/F3/F4 根本性契约问题:GPU 串行 Kahan mean vs np.corrcoef 私有 pairwise 归约在 bias 数据上 corr 差 ~2e-7 >> 1e-12(numpy 私有归约含 SIMD 不可位级复现,契约"不要求复现归约树"与"逐元素 ≤1e-12"在 bias 上不可调和)→ HG-2 契约修订(CLAUDE.md §2 增"归约顺序敏感输入"条款:大偏置|mean|>1e3·σ/var 下溢输入豁免 wrapper parity、改高精度参考判定;低偏置典型输入保持严格 parity 实测 ~1e-17;材料 reviews/hg2_reduction_order_sensitive_input_2026-08-05.md);F1 真 bug 修复(对角 tiny-adjacent var 下溢→NaN:writeback 改读计算路径值 + fallback_kernel 扩含对角 + CPU 参考同步 + 回归用例);F5/F6/F7 测试修复(masked 长 T general 覆盖/anchor row-major+golden 断言/N-cap dummy 指针)。修复后 selfcheck ALL PASS + sanitizer 0 errors + perf 无回归(N=500 5.5ms BEATS gate)
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr v2 fast path 实现 + gate 同面板重新基线:① 设计前置实证推翻 spec §3 硬约束——独立精度验证证明 de-mean Gram(串行 Kahan 均值)与 two-pass 参考位级一致(|gram-two_pass|=0),spec §3 的 8.8e-8 系对比 np.corrcoef/真值(bias 数据归约顺序敏感已知豁免),fast path 对全有效面板(含 bias_1e12)契约合规,无需低偏置 dispatch。② 双路径 dispatch:全列 count==T → fast path(demean_kernel 串行 Kahan 均值+S2 + fast_gemm_corr_kernel 1 累加 Sxy 分层归约,计算量 1/6,无抵消检测);部分有效 → general path(v1 6 累加 + 抵消检测 + 分离 fallback_kernel 扫描上三角 NaN 走 two-pass,热循环外)。③ kCancelRatio 100→3 + 同步 backends.py _CANCEL_RATIO_THRESHOLD(corpus 回退 0.01%→0.10% 可忽略;tie-heavy 合成面板代价诚实记录)。④ selfcheck 增补 10 例(全有效/full-ones mask/dispatch 边界单格 masked/bias 偏移/近常量列/masked bias/N257 边界/dirty-T 常量 0.1@T3+0.7@T3)ALL PASS + sanitizer 0 errors。⑤ 性能:fast path 同面板新 gate(CuPy 全有效面板 exact_half)N=500 ~5.2ms vs 26.35ms(~5× BEATS)、N=2000 ~37ms vs 359.35ms(~10×)、N=5000 ~201ms vs 2382.37ms(~12×);证据 run benchmarks/results/runs/stock_corr_v2_rebaseline_20260805/gate.json(rebaseline_stock_corr_gate_v1.py 可复现)。docs/gate_config_v1.json 保持 corpus 版本未改(check 可复现 PASS)——v2 fast-path gate 是不同面板的独立测量,独立文档化。general path 51.9ms(corpus gate 信息性,ratio3 代价)。⑥ 多视角对抗审查(Workflow 9 agent,~105 万 token)发现并修复 1 个 major bug:fast path 缺精确常量列门——串行 Kahan 均值在 dirty T(如 0.1@T=3)不精确舍回常量 → xd 非零 → S2>0 → 输出有限 r 而非 NaN(契约违反,selfcheck const_0.1 锚点 T=5 恰好舍回掩蔽);修复 fast_gemm 按 col_stats min==max 门 → NaN,新增 fast_const_0.1_T3/0.7_T3 用例钉住。另记录 1 个已知豁免(np/cp _two_pass_corr numpy mean vs kernel Kahan 在 bias 回退格差 ~1.5e-7,归约顺序敏感,v1 已存在)。审查后 selfcheck ALL PASS + sanitizer 0 errors + perf 无回归
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) stock_corr v1 异后端审查修复闭合(响应 reviews/poc3_stock_corr_v1_review_gpt56sol_2026-08-04.md,裁决需修复):F7 移除抵消检测 1e-300 加数(低尺度边界吞真实抵消)+ 同步参考 backends.py _gemm_cancel_mask/cp_stock_corr/cp_factor_corr 三处同款 tiny;F8 主循环改分层归约(per-kKtile 局部串行 + Kahan 外层合并 → 累加误差 T 无关 ~33eps,原串行链 T>~4500 破 1e-12)+ 长 T 对抗测试至 T=262144;F10 two-pass 第二遍 T 条件 Kahan(T>2048 补偿,T≤2048 普通最坏 4.5e-13 保性能);F13 .cuh 文档漂移修复(上三角计算+下三角镜像);F14 数值域前置(col_stats 增 min_abs/max_abs → max|x|>1e150/min 非零|x|<1e-150 返回 -4);F15 static_assert(kBlock==256) + extern __shared__ double;性能 18 项留 v2。selfcheck ALL PASS(7 锚点 + 长 T/tiny/域 -4 + 确定性)+ sanitizer 0 errors。性能诚实:N=500 27.5ms(修复成本 ~2.1ms)仍未达 gate 21.8ms
2026-08-05 DeepSeek-V4-Flash (via Claude Code CLI) parameter_scan v0 异后端审查修复闭合(响应 reviews/poc3_parameter_scan_review_gpt56sol_2026-08-04.md,裁决需修复):F8 float* h_out[4] → float* (&h_out)[4] reference-to-array 编译期强制恰好 4 输出;F9 阻断修复 新增 int (&group_status)[4] 逐组状态输出,实现契约两级失败语义(白名单 cudaErrorInvalidConfiguration/cudaErrorLaunchOutOfResources 于每组合并检查点 → 该组失败 result=None 其余继续;非白名单/D2H 扫描级 fatal;未执行组 -100);F10 错误码语义文档化(负=契约错误/正=扫描级/0=完成且 group_status 权威)。selfcheck ALL PASS(group_status 全 -100 前置断言 + 全 0 成功断言)+ sanitizer 0 errors;perf 35.9ms BEATS 55.34ms gate 无回归
2026-07-30 DeepSeek-V4-Pro (via Claude Code CLI) PLAN.md v1 初版创建
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) PLAN.md 新增"修改记录"区块;登记待定项
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) PLAN v2 重写:响应 GPT-5.6-Sol 审查 21 条(撤 18×/45s、操作语义契约、PoC 先行+三态裁决、修正 ml-quant 接口、显存峰值模型、工具链现状、竞品检索修正、benchmark 协议、压缩 mfaktc、中文名定稿)——响应≠解决:落实状态 解决4/部分11/未解决3/新增3(见复核报告)
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) Phase 0 精化:精核实本机现状(MSVC 19.51/19.44 + VS 内置 CMake 已就绪,仅 CUDA Toolkit 缺失);锁定 CUDA 13.2+;补安装步骤与验证命令
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) §三 竞品深度分析:GitNexus 源码级分析 QuantGplearn / equity-factor-lab,纳入替代方案矩阵,PoC ② 对比对象扩至 QuantGplearn-Torch
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) 文档体系拆分:CLAUDE.md(L0 Spec,载入契约/判据/成功标准/评估/可复现)、CHANGELOG.md(本文件)、RISK.md、README.md 建立;PLAN.md 瘦身为方案主体
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) 竞品分析自 PLAN.md §三 拆分为独立 COMPETITOR_ANALYSIS.md(搜索记录/GitNexus 深度分析/替代矩阵/PoC ② 对比协议);PLAN §三 改为结论+指针
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) Phase 0 自检通过:CUDA v13.3 安装验证 + nvcc 13.3×MSVC 19.51 编译 + GPU vec_add PASS(poc/phase0_selfcheck);RISK R001/R002/R009 缓解
2026-07-31 DeepSeek-V4-Flash (via Claude Code CLI) CMake 骨架 + dev-build.bat(Ninja generator):CMake+CUDA 链路验证通过(phase0_selfcheck 经 CMake 构建 PASS);VS generator 的 CUDA 探测在 CMake 4.3 失败 → 记入 CLAUDE.md 坑位

| 2026-08-02 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ① 契约冻结草案产出:5 区域并行设计 agent + 一致性合成 + 双角度对抗验证(Workflow);首轮 20 条发现(3🔴)全部裁决闭合(22 处修订),次轮 10 条措辞级问题(12 处修订);产出 reviews/_draft_contract.md(24.9KB/143 行,覆盖输入适配/cs_rank/correlation/rolling_ic/parameter_scan,无残留二选一措辞)——待 HG-2 批准后写入 CLAUDE.md 并移除 DRAFT;reviews/_verify_findings.txt 为验证过程产物 | | 2026-08-02 | DeepSeek-V4-Flash (via Claude Code CLI) | 审查文件归档 + gitignore 排除:reviews/、prompts/ 整体加入 .gitignore(内部追踪不公开推送);原根目录 _draft_contract.md/_verify_findings.txt 移入 reviews/;git rm --cached 解除 4 个审查文件(2 reviews + 2 prompts)的跟踪(磁盘保留) | | 2026-08-02 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol PoC ① 契约独立复核 + 修复:提示词 prompts/gpt56sol_poc1_contract_review_prompt.md(内联契约全文+源码锚点,显式排除内部已覆盖 13 项);报告 reviews/poc1_contract_review_gpt56sol_2026-08-02.md(14 条:2🔴/8🟠/4🟡,裁决返工再审)→ 逐条验证修复 13 条(发现4 具体数字未复现但归约顺序方向成立;发现13 PLAN.md 旧口径同步待 HG-2 后随 CLAUDE.md 一并落实):correlation 数值域前置条件+oracle 归约顺序冻结、parameter_scan 可恢复/致命错误 override、签名补全(device/backend/输出容器)、effective spec、计时时间线、unmasked mask 校验 override、rolling_ic 时间线条款降为 fixture 契约、验收三层分离、DLPack 所有权统一、scan 继承 rank bitwise、证据锚点绝对路径+masked 置 0 限定、spec 去重措辞;契约 143→147 行 | | 2026-08-02 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol 第二轮复核 + 修复:提示词 prompts/gpt56sol_poc1_contract_review2_prompt.md;报告 reviews/poc1_contract_review_gpt56sol_review2_2026-08-02.md(10 条:3🔴/5🟠/2🟡;14 条闭合核验 6 CONFIRMED/6 部分/2 未闭合)→ 数值实证完整复现全部 critical(含推翻上轮"3.2 未复现"异议——固定二叉树与 numpy 差 3.5e-3,我上轮用 numpy pairwise 恰好一致):核心裁决删除强制 max-abs 缩放(1e200 属域外直接返回 NaN 与 numpy 一致即可,缩放反而致 3.4e-2 偏差),oracle 冻结为 numpy.corrcoef 直接路径+pairwise 归约唯一语义;修复 3.1-3.10:域外结果唯一冻结为与 numpy 一致、constant_column 条目级退化(A/B/C 反例 0.866 保留)、device 优先级表(rolling CPU fallback 显式例外、correlation 无独立 device 参数)、scan 轴序规范化(user_spec→effective spec 统一展开)、CUDA 组级错误穷尽白名单(InvalidConfiguration/LaunchOutOfResources+cudaGetLastError 检查点)、标签生成器 fixture 实体、DLPack 二次消费冻结 ValueError、failed 计时恒 0+error_stage、asof 锚点收窄;契约 147→148 行 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol 第三轮复核 + 修复:提示词 prompts/gpt56sol_poc1_contract_review3_prompt.md;报告 reviews/poc1_contract_review_gpt56sol_review3_2026-08-02.md(裁决需修复后提交;5 项 HG-2 blocker:3.1 correlation 域外/快捷规则互斥、3.2 "numpy pairwise"非可执行 oracle、3.3 permutation invariance 被证伪、3.4 fixture 无实体、3.5 error_stage schema 冲突;+P1 3.6 被排除格措辞)→ 数值实证完整复现全部反例(域外 4e151 返回 -0.4 非 NaN、n=2 溢出时 numpy=NaN vs 快捷规则 1.0 互斥、SUM_VS_DOT 300 元素 sum=9.0 vs dot=4.0、permutation span 0.027);核心裁决以冻结 wrapper 为唯一 oracle(数学快捷规则让位于 wrapper 行为);修复 7 处:域外统一 ValueError+快捷规则优先级、oracle wrapper 化(取代一切归约算法描述)、删除排列不变承诺、fixture 实体落地、error_stage 定死为固定字段(ok→None/failed→"launch")、被排除格措辞修正;新增实体 tests/fixtures/corr_oracle_v1.py(锁定 numpy corrcoef wrapper,自检 PASS)、tests/fixtures/generate_rolling_ic_labels_v1.py + rolling_ic_labels_v1.json(manifest:h=5/lag=1/40交易日/停牌规则/期望标签/SHA-256)+ rolling_ic_labels_v1.npz;契约 148→149 行 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | HG-2 批准 → PoC ① 契约冻结落实:人工批准冻结契约(含三项显式偏离决策:rank 整数秩 1..K、rolling_ic stable ordinal、correlation backend 默认 cpu);批准材料 reviews/hg2_approval_material_2026-08-03.md。落实:CLAUDE.md 移除 DRAFT 恢复 L0 Spec(操作语义契约段替换为冻结契约 148 行,更新协议/评估计划同步);PLAN.md 同步 3 处旧口径(float32 主线×2、显存"可用显存−安全余量");reference_files.md 登记 tests/fixtures 实体 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ② corpus manifest 提交:Workflow 4 设计+合成+对抗验证(14 条发现,5 MAJOR 全验证为真——descending 反例方向颠倒/基准行范围差一/mask 率口径/tie 舍入/种子架构矛盾)→ 设计定稿 benchmark_corpus/CORPUS_DESIGN_v1.md;落地 8 脚本+元数据(generate/compute_stats/verify/loader/generate_parity_anchors + seeds.json/manifest_schema_v1.json/CORPUS_SCHEMA.md/README.md),结构保持合成(per-role 流、4 层因子束、块状停牌、tie 三剖面、forward_returns 与 fixture 同规);smoke (40×100×4) + parity_anchors 生成并 verify PASS;完整 npz 1218×5000×12 .gitignore(确定性复现+data_sha256 锚定);CLAUDE.md S9/reference_files 登记;MASTER_SEED=20260802 预登记 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol corpus 审查 + 修复 10 条:报告 reviews/poc2_corpus_review_gpt56sol_2026-08-03.md(裁决需修复后支撑;9🔴/1🟠,全部经数值实证确认)→ 修复:#1 常量 IC 前置分支(原得 0.9999 应 NaN)、#2 factor_corr 纳入共享 mask(原 -0.9999 应 1.0)、#3 tie 注入改显式分组+逐日口径(N=5000 moderate 0.498 落带)、#4 RNG 派生改 SHA-256 无损(原低 64 位截断致 20260802/99990802 全碰撞)+ tie 流消费、#5 verify --regenerate 真重生成比对 bytes、#6 --variant 身份路由+real 阻塞+sweep names、#7 manifest 过 Draft-07 schema(family→synthetic + array_sha256)、#8 verifier 数值域 abs 检查+NaN 载荷 uint32 view、#9 parity 重构为 case schema(17 case 含 parameter_scan 容器组)、#10 loader 数组只读;smoke/parity 重新生成全 PASS | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol corpus 第二轮审查 + 修复 7 条:报告 reviews/poc2_corpus_review_gpt56sol_review2_2026-08-03.md(裁决需修复后支撑;4🔴/2🟠;第一轮 10 条闭合核验 5 CONFIRMED/5 部分或未闭合)→ 修复:P1 real 空目录伪摄入阻塞(须含可读原始文件)、P2 seeds.json/设计文档/CLAUDE.md 种子派生同步(SplitMix64→SHA-256)、P3 tie 注入按有效 N 缩放(n_tie_vals≈N/8,N=100/5000 均 0.49-0.50 落带)、P4 sweep regenerate 从 manifest generation_params 恢复(不猜尺寸)、P5 canonical manifest 恢复+stats 写入 manifest(tie 三剖面正确)、P6 parity 重构为 28 case 全含 array_ref+corr_n2 双操作数+10 边界场景全覆盖、P7 loader 物化只读(dict+全数组含 h/lag writeable=False);smoke/canonical/parity 重新生成全 PASS | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol corpus 第三轮审查 + 修复 3 项:报告 reviews/poc2_corpus_review_gpt56sol_review3_2026-08-03.md(裁决需修复后支撑;第二轮 7 条闭合核验 4 CONFIRMED/3 部分或未闭合)→ 修复:R1 real 真摄入 reader 未实现→无条件阻塞 real 身份产物(禁止伪造,README 同步 PoC ② 以 synthetic canonical 为事实源)、R2 设计文档/生成器模块 4 处 SplitMix64 残留同步为 SHA-256(全清)、R6 parity case 重构为按冻结 API 真实可执行(单行面板真实构造 29/30/31 有效数、消除 ic_all_invalid 与 ic_factor_scatter_nan 同参冲突、修正 3 个 rolling IC expected(实算 1.0 不再误写 nan)、underflow 域外改 ValueError、scan 补 (T,N) 二维输入+mask+具体 axes);parity 27 case 重新生成,R6 全部验证匹配 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ② 公平基线(本轮核心):① 安装 GPU 依赖——cupy-cuda13x 14.1.1(CUDA 13.2)+ torch 2.13.0+cu132(替换 CPU 版,约 1.9GB wheel);环境快照 pip_freeze_pre_gpu_20260803.txt 可回滚。② 协议定稿 benchmarks/FAIR_BASELINE_PROTOCOL_v1.md(GATE 关闭:范围=基线建立 / stock_corr N'=500 / numpy rank ordinal 同语义)。③ benchmarks/parity_check_v1.py contract parity——三臂×27 case 全部 27/27 PASS(rank ordinal 逐位 / corr ≤1e-12 / rolling_ic ≤1e-12 / error 组 ValueError);关键裁决:QuantGplearn 用 rank_2d(ordinal 整数秩)非 _rank_pct_dim(percentile)、corr 域前置校验。④ benchmarks/perf_bench_v1.py 性能基准——synthetic canonical 三臂实测:cs_rank numpy 288/CuPy 52/QG 27ms(10.8×)、factor_corr numpy 662ms(FP64 瓶颈 GPU 无优势)、stock_corr N'=500 numpy 36/CuPy 26ms(masked-GEMM,13.8×)、rolling_ic numpy 654/CuPy 128/QG 78ms(8.4×)、parameter_scan numpy 1176/CuPy 204/QG 122ms(9.6×)。⑤ 报告 benchmarks/results/perf_report_v1.{md,json} + parity_report_v1.json;COMPETITOR_ANALYSIS.md 补 §五 实测表。结论:QuantGplearn-Torch 为最佳免费替代(排序/IC 8.4–10.8×);factor-cuda PoC ④ 门槛 = 相对最佳免费替代 ≥2×(cs_rank ≤13.3ms) | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ② 公平基线异后端审查 + 13 条修复:Workflow 双视角(契约对齐/测量公平)×15 verify 全 REAL。修复:① stock_corr 逐对循环→masked-GEMM 向量化(pairwise-complete 用 M^TM/Xm^TM/Xm^TXm,numpy N=500 2.7s→36ms、CuPy 26ms,与 oracle ≤1.1e-16)——推翻原"免费替代不可行、factor-cuda 价值点"结论,协议 §6 决策 2 修订;② QG rolling_ic float32 精度披露(原生 batch_spearmanr,corpus 偏差 1e-7 非 ≤1e-12);③ CuPy perf rolling_ic 补常量截面→NaN(三臂对称);④ parity parameter_scan 恒 PASS→真实 G=4 字典序+schema 校验、NaN 载荷 0x7fc00000 按位校验、_in_corr_domain 改 mask 有效子集域校验;⑤ parity/perf JSON 合并模式(原覆盖致产物单臂)+ _env/_summary 脚本化生成(可复现);⑥ 披露 QG factor_corr 走 numpy oracle(能力映射)。重跑三臂 27/27 PASS + 完整性能数据锁定 | | 2026-08-03 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol 公平基线审查 + P0/P1 修复:审查裁决"需修复"(6🔴/6🟠/1🟡,reviews/poc2_fair_baseline_review_gpt56sol_2026-08-03.md)。核实全部关键发现为真(H1 stock_corr 用错输入+NaN×0、H5 大偏置抵消、H6 13.8×算术错误实为 1.99×)。P0 修复:① 共享算子层 backends.py(parity/perf 同一实现,根治 H4);② stock_corr 用 returns+安全置零+对角+三角镜像(H1/H5);③ rolling_ic 三臂带 mask(H2);④ QG rolling_ic 标 known-deviation 不纳入同语义最佳(H3);⑤ QG 12 corr case 标 N/A 不再走 oracle 充数;⑥ 稳健中心化+CuPy blocking=True 修复 async buffer bug;⑦ cp_rolling_ic 面板向量化(2131→152ms);⑧ 程序化比值修正 13.8×→1.99×、报告改"候选/待复核"(H6)。P1 部分:20 样本+bootstrap CI+完整环境指纹(CPU/驱动/CUDA/BLAS/git)。修复后:numpy 27/27、cupy 27/27、qgplearn 15 PASS+12 N/A;cs_rank QG 27.6ms(10.5×)、stock_corr CuPy 53.6ms(2.0×)、parameter_scan QG 144.3ms(11.7×)。状态=候选/待复核,P1 计时协议(cudaEvent/三口径)未完成 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol 公平基线第二轮审查 + 修复(commit 0ca6e6c):裁决"需修复"(闭合 4/13、部分 6/13、未闭合 3/13,reviews/poc2_fair_baseline_review_gpt56sol_review2_2026-08-03.md)→ 修复 H5/R5/R3:factor_corr/stock_corr 改 pair-specific 两遍中心化(大偏置 base=1e12/1e15 与 oracle |Δ|=0)、R5 域校验只查 finite∧mask 参与元素(masked-out 1e151 不再误拒)、R3 扩展锚点真传 mask + 独立 ordinal-Spearman oracle + stock_corr correctness 锚点。修复后 numpy 27/27+ext 6/6、cupy 27/27+ext 6/6、QG 15+12N/A。IMPLEMENTATION.md 异后端审查跑完(裁决 BLOCK/REVISE,8🔴/7🟠/2🟡,reviews/implementation_review_gpt56sol_2026-08-03.md) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ② 公平基线待续项修复 R2/R4/R6 + S1-S6(commit d467991,接续爆上下文窗口):perf_bench_v1.py v2.0.0 重构——R2 不可变 run-id 目录 results/runs/<run_id>/ + 禁读旧 JSON 合并 + --render JSON→Markdown 同生成链 + corpus/hash/commit 一致性拒绝 + speedup 从 JSON 复算;R4 cold 在 GPU 预上传前测(首 op 含 CUDA context 初始化)/ resident 纯设备 API(cp_cs_rank_gpu/cp_rolling_ic_gpu/qg_cs_rank_device/qg_rolling_ic_device)/ corr 无纯设备→pure_device=False 诚实标注 / upload 全输入 H2D / native event per backend;R6 --stock-sizes 500,2000,5000 每规模独立 JSON(耗时/CI/显存峰值/OOM/状态)+ np/cp_stock_corr 加 masked-GEMM 快路径+抵消检测回退(协议 §6.2 冻结语义,大偏置 |Δr|≤1e-12 保持);S1 parity bool 规范化(np.bool_→bool+_json_safe)/ S2 parameter_scan 逐元素 oracle+异常来源断言 / S3 N guard fail-fast / S4 _as_cupy 同 dtype 零拷贝 / S5 验证已由 CPU 回拷隐式解决 / S6 in_corr_domain 可选 import cupy。parity 回归 numpy/cupy 27/27+ext 6/6、QG 15+12N/A | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | IMPLEMENTATION.md v0.1 → v0.2 修订(响应 GPT-5.6-Sol 实现设计审查 BLOCK/REVISE 17 项:8🔴/7🟠/2🟡,reviews/implementation_review_gpt56sol_2026-08-03.md):H1 factor_corr 显存按真实 fp64 重算(X64/Xm 各 584.64MB,三全量 1.361GiB)+ 二维 factor-block schedule;H2 stock_corr 改 pairwise-complete pair-tile 两遍算法(pair-specific means);H3 冻结规范归约树(observation microtile 256 + 局部树 + 全局合并树 + identity padding,chunk 不改括号);H4 对抗数值 corpus 证明 |Δr|≤1e-12;H5 stock_corr 正式 Gate(N=500)与扩展(N=2000/5000)拆分;H6 CUDA 失败状态机(两码白名单降级 + fatal 扫描级终止);H7 适配层决策 = PoC ③ NumPy-only 私有原型(CUDA/DLPack 直通 → Phase 1);H8 rolling_ic 完整可实施算法(共同有效集/双 ordinal key/Pearson 固定树);M1 冻结 CUB DoubleBuffer overload + canonical 152,255,131B 锚点;M2 rolling_ic 输出 (T,) fp64=9,744B + f32/f64 分路径;M3 stock_corr 下界条件化(CUDA 输出 8N² vs CPU 输出 tile D2H);M4 冻结 cudaEvent/wall 时间线;M5 needs_mask(全 unmasked 不触碰 mask);M6 测试改契约条款→测试 ID→fixture→判据→后端追踪矩阵;M7 F_chunk 二维 lower-triangle schedule;L1 余量标默认策略 + 校准 + fail-fast;L2 scan 预算一阶粗估 + 不宣称 overlap。Gate 表更新为 canonical 实测(cs_rank ≤14.9ms / parameter_scan ≤70.4ms / factor_corr ≤1759.7ms / rolling_ic ≤80.75ms / stock_corr N=500 ≤27.65ms) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | GPT-5.6-Sol fair baseline 三轮审查 + 修复 9 项(reviews/poc2_fair_baseline_review_gpt56sol_review3_2026-08-04.md,裁决"需修复";commit ef18be3):H-01 GEMM 抵消检测阈值 1e3→100 + |r|>1 合理性二次判定(反例 ratio=28/rho=-0.99 的 |Δr| 从 1.14e-12 超差→0;canonical 回退率 <0.01% 性能无损;parity 加 ext_gemm_cancel_adversarial 回归);H-02 run-id 已存在默认拒绝 + completion manifest(原子证据);H-03 renderer 只读 canonical 文件名(numpy/cupy/qgplearn.json),raw repeats 移 raw/ 子目录;H-04 renderer 完整校验(run-id==目录名 / 三臂齐全唯一 / 无顶层 error / version 一致 / 无操作级 error-oom,缺臂即拒绝);M-01 CuPy stock/factor_corr 域检查改逐元素参与元素(修复 masked-out 跨列极端值误拒,NumPy/CuPy 语义一致);M-02 memory_peak 改后台线程采样(前后净差在 pool 复用时报 0 失真);M-03 stock_corr 记录 requested_N/actual_N,请求超 corpus 列数 → status=skipped;M-04 gpu_kernel_ms→gpu_inclusive_ms(host wrapper event 含复制/同步)、upload 用对应 backend 同步、stock_corr 独立生命周期;L-01 parity 删未用 cupy import(无 CuPy 环境 numpy 臂 27/27+ext 7/7 可独立运行) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | IMPLEMENTATION.md v0.2 → v0.3 修订(响应 GPT-5.6-Sol 复核 14 项 F-01F-14,reviews/implementation_review_gpt56sol_review2_2026-08-04.md,裁决需修复非 REDESIGN):F-01 factor_corr 改 pair-tile 在线中心化(废 factor-level Xm,每 pair tile 分配 left/right raw fp64);F-02 规范归约树补逐操作伪代码(factor/stock/rolling 各自 leaf index、partial struct、merge、identity、全局树高度、跨 chunk carry/stitch、workspace 公式);F-03 H4 选定唯一确定性算法(固定树 fp64 两遍 + 阈值 100 触发 Kahan + CPU fallback 限调试)+ 对抗 corpus fixture manifest(f32 扰动按 ULP);F-04 rolling_ic 显存重算 f32 207,074,620 B(197.48 MiB)/ f64 304,514,620 B(290.41 MiB);F-05 M7 补 block-pair schedule 表;F-06 CUB d_keys/d_values Current 分别取 + canonical 152,254,876 B + temp;F-07 五操作私有 API 表(np.ascontiguousarray/TypeError 文本/私有符号 fcu 不导出);F-08 测试矩阵展开实体参数(三层验收 + 逐 stage fault injection + partial/merge 插桩);F-09 elapsed_ms 直接对齐 CLAUDE.md 入口→返回;F-10 rolling_ic 冻结 full-N sentinel 单一路径(uint32/uint64 常量);F-11 安全余量冻结 512 MiB 字节常量 + p99 校准;F-12 日期统一 2026-08-04(北京时间);F-13 T×N checked multiply + INT32_MAX guard;F-14 Gate 常量 raw/2 全精度(向严格取整) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | IMPLEMENTATION.md v0.3 → v0.4 + 实体资产落盘(响应 GPT-5.6-Sol 三审 11 项 R3-0111,reviews/implementation_review_gpt56sol_review3_2026-08-04.md,裁决需修复非 REDESIGN;F-06/F-09/F-10/F-13 确认闭合):R3-01 三份逐语句归约伪代码(typed Partial1/Partial2/PartialK struct、leaf/merge、跨 chunk binary frontier、ping-pong workspace 字节公式);R3-02 Kahan 补偿状态机(sum/c、leaf 更新、merge、跨 chunk)+ 触发判据改"偏置显著∧ratio>100"(普通低相关数据不进 Kahan)+ 对抗 corpus 落盘(tests/fixtures/corr_corpus_v1.*,12 case,含 f32 ULP 扰动坍缩常量实证);R3-03 主对角退化真值表(非退化才 1.0,常量/全无效/n<2/oracle 非有限→NaN);R3-04 factor block shape 统一(left/right edge (T,N,w))+ F_c 完整容量不等式 + outer-left cache 冻结;R3-05 stock_corr 专属 N_c/block schedule(raw 修正非 F=12 误带)+ pair workspace 建模;R3-06 rolling_ic 峰值时间线修正(rank2 分配且 DB 尚存时 207/304 MiB)+ workspace 上界;R3-07 factor/stock f32/f64 双显存模型;R3-08 测试三层实体矩阵(黑盒/静态-IR/运行插桩 + parameter_scan 四套期望字典);R3-09 Gate 机器配置自动生成(benchmarks/generate_gate_config_v1.py → docs/gate_config_v1.json,raw/2 全精度,display 向负无穷取整,SHA-256);R3-10 rolling_ic 每 launch checked multiply + test_rolling_guard.py;R3-11 reserve 具名 p99 算法 + 安全减法(free≤reserve 先判断防无符号下溢)+ 校准持久化 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | IMPLEMENTATION.md v0.4 → v0.5 + 实体资产修正(响应四审 R3-0111,reviews/implementation_review_gpt56sol_review4_2026-08-04.md,裁决需修复非 REDESIGN):R3-01 三操作完整参考伪代码(typed struct + static_assert + BinaryFrontier + 唯一 current+next workspace 模型);R3-02 CompensatedSum 完整定义(add_scalar/merge_state/finalize)+ PartialK1 补 count + trigger 改 bias_metric=max(|x|)/sqrt(Sxx/n) + corpus v1.1 修正(真 float32 dtype、branch 状态机、严格 manifest——bias_1e12/1e15/near_zero_var/f64_ulp→kahan,f32_ulp 量化坍缩→nan);R3-03 设备退化决策树(count<2→NaN、zero_var→NaN、!finite→NaN、否则 1.0)+ min/max 入 Partial1;R3-04 factor 完整容量不等式 + 唯一 outer-left cache 生命周期 + sub-block gather;R3-05 stock output tile 修正(off-diag N_ci·N_cj)+ candidate solver;R3-06 rolling 4 mixed dtype + workspace 精确字节;R3-07 f64 alias/gather 条件;R3-08 test_cases_v1.json 落盘(机器可读 case manifest + parameter_scan 四套 expected dict + fault 白名单对齐契约);R3-09 Gate 配置补 source provenance(source_path/SHA + config_payload_sha256);R3-10 F-10 full-N sentinel 全文恢复 + rolling 每 launch checked multiply 伪代码;R3-11 reserve 消费规则 max(512MiB,p99) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | IMPLEMENTATION v0.5 → v0.6 + 数值 bug 修复 + workspace/solver 资产(响应五审 13 项 F5-0113,reviews/implementation_review_gpt56sol_review5_2026-08-04.md):F5-03 closed Partial1 extrema 改 double(40→56B,f64 相邻 ULP 误判常量修复);F5-04 closed Pearson finalize 改逐次归一化(Sxy/sqrt(Sxx)/sqrt(Syy) 防中间乘积溢出)+ corpus v1.2 加 pearson_overflow/f64_adjacent_ulp fixture;F5-11 closed ordinal transform 先 canonicalize ±0;F5-01 三操作完整独立伪代码 + BinaryFrontier 逐语句 + static_assert;F5-02 CompensatedSum 唯一表示/merge 顺序;F5-05/06 factor/stock solver 实际解落盘(compute_workspace_v1.py → workspace_v1.json:factor F_c=12/1601MB、stock N=500/2000/5000 单块全可行);F5-10 Gate source_path 完整 repo-relative;F5-13 §0 状态改 proposed/partial/closed 诚实标注(3 closed + 9 proposed/partial 待六审) | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | IMPLEMENTATION v0.7 自包含 + 自修复闭合(六审 15 项 F5-0113 + N6-01/02,validate_self_fix_v1.py PASS 15/15):自修复模式首次实践(用户 2026-08-04 决策:GPT-5.6-Sol 修自己发现的 bug + Claude 异后端核对,终止"我修→审查→再修"无限循环)。Codex 卡死后 Claude 收尾:v0.7 自包含文档(三参考函数/BinaryFrontier/CompensatedSum sum-c/-right.c/safe_pearson 逐次除法/ABI 表/status 状态块)、corr_math_v1.py 单一真源、compute_workspace v2(Timeline+HWM+solver 12/36/8/16)、gate --check、calibration、test_cases 50/7;修复 Codex 生成器/验证器多处不一致(fatal stage 名/output_mode/cub_query/variants/first_infeasible/SAFE_PEARSON/calibration $id);独立验证 parity numpy 27/27+ext 7/7、corr 生成确定性字节一致、已闭合项未回退 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | stock_corr v0 异后端审查 + 修复闭合(commit ce22cd0,裁决 REDESIGN):GPT-5.6-Sol 独立审查 66 行/7 发现——F1 阻断修复 corr_kernel 只覆盖 256 宽上三角带(N>256 大量 pair 未算、writeback 读未初始化)→ j-tile 布局任意 N 全覆盖 + N=257/300 边界面板 48 case 验证;F2 修复 自验边界 N<=24 绕过 → 加 N>256 面板;F3 修复 动态共享 9T 无 guard → 设备上限查询返 -4;F4 修复 朴素 mean 归约顺序敏感(1e12 偏置 corr 差 1e-7)→ Kahan mean + bias_1e12_pair 测试;F5 修复 safe_pearson 补 isfinite(sxy)+最终 r;F6 记录 数值域校验属高层 adapter;F7 修复 .cuh 文档漂移。修复后 selfcheck ALL PASS(含 N>256 全覆盖)+ sanitizer 0 errors。性能诚实声明:修复后完整工作量 N=500 33.6ms/2000 433ms/5000 2637ms 未达 gate(21.8/268.7/1279.4)——O(N²×T) 无列复用,PoC ④ 需 masked-GEMM 分块;正确性闭环 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ stock_corr v0 kernel(commit 9512181):src/stock_corr.{cuh,cu} (T,N)→(N,N) 股票相关矩阵。转置((N,T) column-major + valid)→ col_stats(每列 count/sum/min/max 对角退化门)→ corr_kernel(per-pair 两遍中心化 + joint valid 子集 mean + 常量列显式 NaN)→ writeback(对角 1.0/NaN + 严格下三角镜像)。poc3_stock_corr_selfcheck:锚点 + 随机面板 + 确定性 + 错误 smoke,ALL PASS(初版自验边界 N<=24,审查 F1 揭示 N>256 覆盖缺陷后修复)。poc3_stock_corr_perf:初版部分工作量 N=500 20.8ms 假象,完整工作量见审查修复后 33.6ms | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | factor_corr v0 异后端审查 + 修复闭合(commit 196320c):GPT-5.6-Sol 独立审查(reviews/poc3_factor_corr_review_gpt56sol_2026-08-04.md,55 行/5 发现,裁决需修复)——F1 拒绝(交叉项抵消:误差上界 ~2.2e-16 << 1e-12,构造极端抵消/尺度失配/反相关场景无数值反例);F2 修复 safe_pearson 加 isfinite(sxx/syy) 守卫(二阶和溢出 inf → NaN 非静默 0,触发需 R>2e8 物理不可达但防御性正确);F3 修复 finalize_p2 对 jointly-valid 常量列显式 min==max → NaN 且不触发 Kahan(0.1/0.3/1e-10 非精确常量列因浮点 mean 无法位精确重构产生伪方差致有限相关的 bug;CPU 参考同步);F4 修复 d_F 提前释放仅成功时置空(free 失败保留指针供 fail 路径重试);F5 记录 KahanAcc::add 无 ab+c 模式不可 FMA,normal 路径 FMA 仅改逐位舍入在 1e-12 容差内。selfcheck 新增 special=3(列常量 0.1)回归 → ALL PASS 0 FAIL;perf 219.3ms BEATS 无回归;sanitizer 0 errors。响应:reviews/poc3_factor_corr_review_response_gpt56sol_2026-08-04.md | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ factor_corr v0 kernel(最复杂 corr 算子)(commit 434ee6b):src/factor_corr.{cuh,cu} (T,N,F)→(F,F) factor 相关矩阵。pipeline——transpose_preprocess((TN,F) row-major → (F,TN) column-major 使每列连续 + valid=mask∧finite,mask 广播到 F 列等价 np_factor_corr)→ reduce_p1(每 pair 一 block,strided 累加 Partial1 count/sum/min/max,固定共享树归约禁 atomicAdd)→ finalize_p1 mean → reduce_p2(中心化 Partial2 sxx/syy/sxy)→ finalize_p2 safe_pearson + corpus 触发状态机(bias_metric=max(max|x|/sqrt(sxx/n),max|y|/sqrt(syy/n)) > 1e8 或 |r|>1 或非有限 → Kahan CompensatedSum 重算)→ writeback(对角 count≥2∧min≠max→1.0 否则 NaN;严格下三角镜像 r[i,j]==r[j,i] 逐位)。正确性:poc3_factor_corr_selfcheck 16 corpus anchors(bias_1e12/1e15、near_±1、near_zero_var、sparse_mask、f32/f64_ulp_bias、constant_col、all_invalid、n_lt_2、pearson_overflow、f64_adjacent_ulp、stable_zero)+ 随机面板 + 确定性,GPU vs 同算法 CPU 参考 1e-12 全 PASS(bias_1e15/f64_ulp_bias numpy exp 差异 = 归约顺序敏感已知豁免,CLAUDE.md §2 uncentered_gram edge cases;GPU==CPU 参考保证)。性能:corpus 1218×5000×12 median 215ms < 门槛 1543.52ms(BEATS 7×);峰值显存 ~1188MB;sanitizer 0 errors。已修 bug:① host 读 d_trigger 用 vector<int> 字节错位(uint8 数据)致 Kahan 触发误判 → 改 uint8;② Kahan 单线程扫描慢 3s(3 触发 pair×6.09M 行)→ 多线程 strided+共享树归约(R≥256 用 256 线程,R<256 单线程保补偿)→ 215ms。corr_anchors.h 由 corpus npz 确定性生成 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ 开工:cs_rank v0 kernel(第一个真实 CUDA kernel)(commit 5059caa):src/cross_sectional_rank.{cuh,cu} 3-kernel pipeline——preprocess(canonical_ordinal_key_f32 单调变换,对照 corr_math_v1.py 单一真源;±0 折叠 tie;非有限→0xFFFFFFFF 哨兵排段尾;descending 对值取负走 ascending)→ cub::DeviceSegmentedRadixSort::SortPairs DoubleBuffer 分段稳定排序(d_keys/d_values Current 分别取,规则段 offset[t]=tN)→ scatter(rank=段内位置+1,payload 散射回列索引,无效格写 NaN 0x7fc00000)。host checked multiply TN≤INT32_MAX、N≤2^24。正确性:poc/poc3_cs_rank_selfcheck.cu 内嵌 CPU 参考(等价 np_cs_rank),6 parity 锚点 + 144 随机(NaN/±inf/±0/tie/mask × asc/desc × 3 run)全部位级 PASS;compute-sanitizer 0 device errors。性能:poc/poc3_cs_rank_perf.cu corpus 规模 1218×5000 端到端 median 13.7–15.4ms(GPU 温度/时钟波动),vs 门槛 exact_half 13.926ms 边缘(偶超,PoC ④ 需优化:CUB temp 缓存/pinned 传输);显存峰值 ~154–166MB(公式 152MB+temp 吻合,非显存主导)。工具链坑:CUDA 13.3 CUB 移入 include/cccl/、cudart64_13.dll 在 bin/x64/、CCCL 须 -Xcompiler=/Zc:preprocessor。CMake 3 targets(phase0 + selfcheck + perf)+ dev-build.bat 全流程 PASS |:① 2026-07-31 GPT-5.6-Sol 首轮审查 v1(21 条:6🔴/11🟠/4🟡,裁决 PoC 先行)→ reviews/plan_review_gpt56sol_2026-07-31.md。② 2026-07-31 v2 复核(17 条:4🔴/9🟠/4🟡,CLAUDE.md 降 DRAFT)→ reviews/plan_claude_md_review_gpt56sol_2026-07-31.md。 | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | mem_tracker 异后端审查 + 修复闭合(commit 2ce1f08):GPT-5.6-Sol 独立审查(reviews/poc3_mem_tracker_review_gpt56sol_2026-08-04.md,62 行/11 发现,7min 完成,裁决需修复)——F1/F2 unknown 指针 fallback 改 strict(返回错误+诊断计数,杜绝静默漏记);F3 Free 事件 logical/aligned 双口径;F4 Alloc 异常安全事务(元数据抛异常回滚设备分配);F5 checked 溢出;F6 删除拷贝/移动(复制致账本悬空);F7/F8 验证程序改高频采样(cudaMalloc 同步分配无需逐次同步)+ 双边界断言 [0,64MiB];F9 采样线程 cudaSetDevice;F10 错误路径 smoke(N>2^24/T=0 guard);F11 记录。修复后三口径校准仍 delta 0、150 case 位级 PASS、perf 无退化 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | rolling_ic v0 异后端审查 + 修复闭合(commit 1775844):GPT-5.6-Sol 独立审查 71 行/5 发现(12m45s,裁决需修复);7 项聚焦核对全过(常量检测等价性/原子统计/syncthreads/CUB 两轮/mask/scatter/确定性)——无核心算法 bug。F1 契约澄清 min_valid≥2(guard -4 正确);F2/F5 记录数值契约规模限定(1e-12 验证至 N≤5000、determinism 同设备承诺);F3 selfcheck 补错误路径 smoke(min_valid<2/T=0);F4 记录 T*N≤INT32_MAX 实现上限。修复后 85 case PASS 无回归 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ 步骤⑥ rolling_ic v0 kernel(commit 443f45d):pipeline——preprocess(f64 canonical key + payload 列索引 + 每行 valid_count/key min-max 常量检测)→ 2× CUB SortPairs DoubleBuffer(uint64 key,factor/returns 各一轮)→ 2× scatter rank → 逐行两遍中心化 Pearson(float64,固定树归约禁 atomicAdd);min_valid/常量 guard→NaN。统一 f64 路径匹配 np_rolling_ic(upcast 语义,f32 无损)。poc3_rolling_ic_selfcheck:11 parity 锚点(ic_tie1/2、ic_nan、ic_inf_neginf、ic_tradable_nan、ic_valid_29/30/31、ic_all_invalid、常量因子/收益)+ 72 随机 1e-12 全 PASS(修 preprocess 漏 payload 初始化 bug)。poc3_rolling_ic_perf:corpus 规模端到端 median 48.5ms < 门槛 77.18ms(BEATS,1.59× 余量);峰值显存 ~502MB(双排序 buffer+rank 数组,<7676MB 非主导);无泄漏 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ 步骤② mem_tracker 基础设施 + cs_rank 显存校准(commit d778d43):src/mem_tracker.{h,cu} HWM 分配器——包装 cudaMalloc/cudaFree 追踪 live_bytes/peak_live/事件日志,256B 对齐匹配 compute_workspace_v1.py Timeline(align256);cs_rank_gpu 加可选 MemTracker*(默认 nullptr 不跟踪,selfcheck/perf 不受影响)。poc/poc3_mem_tracker_selfcheck 三口径校准 PASS:理论逻辑和 152,254,876 B MATCH canonical anchor(IMPLEMENTATION F-06);tracker HWM 152,256,768 B == 理论 align256+CUB temp(delta 0,分配确定性验证);driver cudaMemGetInfo 采样 166 MiB = tracker + 20.8 MiB 驱动开销(符合预期);final live 0(无泄漏)。校准纪律 §3.3 达成:公式 vs HWM = 0(精确)、HWM vs 驱动 ≲ 驱动开销。CMake 4 targets + dev-build 全流程 PASS | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) + GPT-5.6-Sol | cs_rank v0 kernel 异后端审查 + 修复闭合(commit 1a9e940):GPT-5.6-Sol 独立审查(reviews/poc3_cs_rank_review_gpt56sol_2026-08-04.md,50 行/6 发现,裁决需修复)——核心算法/冻结语义 7 项核对全部通过(CUB DoubleBuffer/canonical key/invalid 哨兵/scatter 无写冲突/NaN 载荷/N 边界/确定性);F1 grid 计算改 int64(total+block-1 在 total=INT32_MAX 时符号溢出);F2 offsets 改 device kernel 生成(消除 host 8GB vector bad_alloc + int 循环末次溢出);F3 FreeAllBuffers helper 保留首个 cudaFree 错误(成功路径不再静默吞错);F4/5/6(workspace 缓存/stream API/CCCL 版本矩阵)记录为 PoC ④ 优化方向。修复后 150 case 位级 PASS + compute-sanitizer 0 errors + perf 无退化(15.2ms)。本次审查提示词含防超时限制(scope/单次响应/输出≤120行/发现≤20条)→ 50 行 6 发现 快速闭合,对比 v0.7 六审 15 项自修复的 2h 卡死显著改善 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ parameter_scan v0 kernel(commit d039cb5):G=4 字典序(asc+masked/asc+unmasked/desc+masked/desc+unmasked,CLAUDE.md §4 契约)参数扫描,复用已验证 cs_rank pipeline,单次 H2D + 逐组 D2H 物化;cs_rank_gpu 零改动零回归。selfcheck ALL PASS(error-path smoke 错误码精确 -1/-2/-3、dict_order 锚点、随机 vs CPU 逐位、每组与单次 cs_rank 逐位一致、确定性);perf corpus 1218×5000 37.14ms BEATS gate 55.34ms(vs QG 原生 110.69ms 3×);显存峰值 ~166MiB 无泄漏 | | 2026-08-04 | DeepSeek-V4-Flash (via Claude Code CLI) | PoC ③ stock_corr v1 masked-GEMM 上三角优化(commit 516d144):v0 per-pair 两遍 O(N²×T) 无列复用 → one-pass masked-GEMM——转置输出 Xm/M(column-major 连续列)→ gemm kernel 16×16 tile × 1格/线程 × 6 累加(n/sumx/sumy/sumxy/sumx2/sumy2)→ 未中心化 Gram corr(ddof 抵消);1D grid 只枚举上三角 tile(无空转 block);抵消检测(|未中心化项|>100×残差)/ |r|>1 / joint 常量 var 相对门 → 就地 two-pass 中心化回退(Kahan mean + min==max),镜像 backends.py _gemm_cancel_mask 语义。selfcheck ALL PASS(锚点 + N=257/300 超 tile 边界 + bias_1e12 + 确定性 + 错误 smoke);性能(诚实,未达标):N=500 ~25ms(v0 33.6,gate 21.8)、N=2000 ~303ms(v0 433,gate 268.7)、N=5000 ~1857ms(v0 2637,gate 1279)——RTX 4060 fp64 手写峰值实测 ~124 GFLOPS 限制 Gram flop 数(N=5000 gate 需 ~143 GFLOPS 超手写上限),缺口留 PoC ④(split-K/双缓冲/df64) |