|
| 1 | +#!/usr/bin/env python3 |
| 2 | +"""V139: component-specific applicability induced by V138. |
| 3 | +
|
| 4 | +The whole-V135 two-literal gate was not admitted, but all V138 meta-folds selected |
| 5 | +support_log<=q80 AND prior_disp>q20. V139 asks whether that geometry belongs only |
| 6 | +to the objective-prior component. Composition-only is retained everywhere else. |
| 7 | +""" |
| 8 | +from __future__ import annotations |
| 9 | +import argparse,json,time |
| 10 | +from pathlib import Path |
| 11 | +import numpy as np |
| 12 | +from sklearn.model_selection import GroupKFold |
| 13 | +from sklearn.metrics import log_loss |
| 14 | + |
| 15 | +from v75_canonical_trajectory import load_training,SEED |
| 16 | +from v71_mastery_events import load_transcript |
| 17 | +from v85_evidence_state import build_v75 |
| 18 | +from v94_related_control import segmented_control,build_control |
| 19 | +from v135_nested_supported_stack import components,feats,fit_stack,EPS,logit |
| 20 | + |
| 21 | +RNG_SEED=20260823 |
| 22 | +SUPPORT_Q=.80 |
| 23 | +DISP_Q=.20 |
| 24 | + |
| 25 | +def main(a): |
| 26 | + t0=time.time(); f=load_training(a.features,a.labels).reset_index(drop=True) |
| 27 | + y=f.target.to_numpy(int); support=f.learning_objective.astype(str).to_numpy(); sessions=f.session_id.astype(str).to_numpy() |
| 28 | + obj=(f.learning_objective_id if 'learning_objective_id' in f else f.learning_objective).astype(str).to_numpy() |
| 29 | + print('ROWS',len(f),'SESSIONS',len(np.unique(sessions)),'OBJECTIVES',len(np.unique(obj)),flush=True) |
| 30 | + cache={}; us=np.unique(sessions) |
| 31 | + for j,sid in enumerate(us,1): |
| 32 | + cache[str(sid)]=load_transcript(a.transcripts/f'{sid}.csv') |
| 33 | + if j%2500==0: print('TRANSCRIPTS',j,'/',len(us),'elapsed',round(time.time()-t0,1),flush=True) |
| 34 | + X75=build_v75(f,cache); print('V75',X75.shape,X75.nnz,'elapsed',round(time.time()-t0,1),flush=True) |
| 35 | + rt=[];rz=[] |
| 36 | + for i,r in f.iterrows(): |
| 37 | + text,z=segmented_control(cache[str(r.session_id)],str(r.learning_objective),'related'); rt.append(text);rz.append(z) |
| 38 | + if (i+1)%5000==0: print('RELATED_ROWS',i+1,'elapsed',round(time.time()-t0,1),flush=True) |
| 39 | + Xr=build_control(rt,rz); print('RELATED',Xr.shape,Xr.nnz,'elapsed',round(time.time()-t0,1),flush=True) |
| 40 | + |
| 41 | + n=len(y); P0=np.zeros(n);P1=np.zeros(n);P2=np.zeros(n);PG=np.zeros(n);PC=np.zeros(n);GM=np.zeros(n,bool) |
| 42 | + folds=[]; rng=np.random.default_rng(RNG_SEED) |
| 43 | + outer=list(GroupKFold(4).split(np.zeros(n),y,sessions)) |
| 44 | + for k,(tr,va) in enumerate(outer,1): |
| 45 | + q0,o75,orr,opp,oc,oseen=components(X75,Xr,y,tr,va,support) |
| 46 | + ig=sessions[tr]; inner=list(GroupKFold(3).split(np.zeros(len(tr)),y[tr],ig)) |
| 47 | + ip75=np.zeros(len(tr));ipr=np.zeros(len(tr));ipp=np.zeros(len(tr));ic=np.zeros(len(tr));iseen=np.zeros(len(tr),bool) |
| 48 | + for ltr,lva in inner: |
| 49 | + atr=tr[ltr];ava=tr[lva] |
| 50 | + _,a75,ar,ap,ac,aseen=components(X75,Xr,y,atr,ava,support) |
| 51 | + ip75[lva]=a75;ipr[lva]=ar;ipp[lva]=ap;ic[lva]=ac;iseen[lva]=aseen |
| 52 | + fitmask=iseen |
| 53 | + m1=fit_stack(feats(ip75[fitmask],ipr[fitmask],ipp[fitmask],ic[fitmask],False),y[tr][fitmask]) |
| 54 | + m2=fit_stack(feats(ip75[fitmask],ipr[fitmask],ipp[fitmask],ic[fitmask],True),y[tr][fitmask]) |
| 55 | + q1=q0.copy();q2=q0.copy() |
| 56 | + if oseen.any(): |
| 57 | + q1[oseen]=np.clip(m1.predict_proba(feats(o75[oseen],orr[oseen],opp[oseen],oc[oseen],False))[:,1],EPS,1-EPS) |
| 58 | + q2[oseen]=np.clip(m2.predict_proba(feats(o75[oseen],orr[oseen],opp[oseen],oc[oseen],True))[:,1],EPS,1-EPS) |
| 59 | + |
| 60 | + # Frozen V138-derived component region. Thresholds come only from outer-training inner-OOF fields. |
| 61 | + train_support=np.log1p(ic[fitmask]) |
| 62 | + train_disp=np.abs(logit(ipp[fitmask])-logit(ip75[fitmask])) |
| 63 | + sth=float(np.quantile(train_support,SUPPORT_Q)); dth=float(np.quantile(train_disp,DISP_Q)) |
| 64 | + outer_support=np.log1p(oc); outer_disp=np.abs(logit(opp)-logit(o75)) |
| 65 | + gm=oseen & (outer_support<=sth) & (outer_disp>dth) |
| 66 | + qg=q1.copy(); qg[gm]=q2[gm] |
| 67 | + |
| 68 | + # Matched-coverage random prior activation among supported rows. |
| 69 | + sup_idx=np.flatnonzero(oseen); n_on=int(gm.sum()); cm=np.zeros(len(va),bool) |
| 70 | + if n_on>0: |
| 71 | + chosen=rng.choice(sup_idx,size=n_on,replace=False); cm[chosen]=True |
| 72 | + qc=q1.copy(); qc[cm]=q2[cm] |
| 73 | + |
| 74 | + P0[va]=q0;P1[va]=q1;P2[va]=q2;PG[va]=qg;PC[va]=qc;GM[va]=gm |
| 75 | + fr={'fold':k,'rows':int(len(va)),'supported_fraction':float(oseen.mean()),'prior_coverage':float(gm.mean()), |
| 76 | + 'support_q80_threshold':sth,'prior_disp_q20_threshold':dth, |
| 77 | + 'v97_ll':float(log_loss(y[va],q0)),'composition_ll':float(log_loss(y[va],q1)), |
| 78 | + 'full_v135_ll':float(log_loss(y[va],q2)),'component_ll':float(log_loss(y[va],qg)), |
| 79 | + 'random_control_ll':float(log_loss(y[va],qc))} |
| 80 | + folds.append(fr);print('FOLD',json.dumps(fr),flush=True) |
| 81 | + |
| 82 | + l0=float(log_loss(y,P0));l1=float(log_loss(y,P1));l2=float(log_loss(y,P2));lg=float(log_loss(y,PG));lc=float(log_loss(y,PC)) |
| 83 | + inc=l2-lg; causal=lc-lg; all_nonreg=all(r['component_ll']<=r['v97_ll']+1e-12 for r in folds); beats=sum(r['component_ll']<r['full_v135_ll'] for r in folds) |
| 84 | + if inc>=.0005 and causal>=.0005 and beats>=3 and all_nonreg: |
| 85 | + verdict='PROMOTE_COMPONENT_LAW'; next_action='competition_shaped_runtime_verification' |
| 86 | + elif inc>0 and causal>=.0002 and beats>=3: |
| 87 | + verdict='RETAIN_COMPONENT_SIGNAL'; next_action='attack_then_untouched_verification' |
| 88 | + else: |
| 89 | + verdict='CLOSE_COMPONENT_APPLICABILITY_HYPOTHESIS'; next_action='zoom_out_beyond_current_composition_applicability' |
| 90 | + out={'protocol':'V139_COMPONENT_APPLICABILITY','rows':int(n), |
| 91 | + 'controller':{'push':'full_v135','residual':'V138 stable support x prior-displacement geometry but whole-operator gate unadmitted', |
| 92 | + 'diagnosis':{'primary':'component_applicability','secondary':'composition_representation'}, |
| 93 | + 'rival':'V138 interaction is incidental and matched random prior activation performs as well', |
| 94 | + 'K_effect':['retain_v97_unsupported','retain_composition_outside_prior_region','label_free_inference','beat_full_v135','beat_matched_random_control'], |
| 95 | + 'operator':'composition-only on supported rows except full V135 when support_log<=train_q80 and prior_disp>train_q20', |
| 96 | + 'control':'same-count random prior activation','epistemic_status':'second_generation_mechanism_test_not_final_admission'}, |
| 97 | + 'v97_ll':l0,'composition_ll':l1,'composition_gain':l0-l1,'full_v135_ll':l2,'full_v135_gain':l0-l2, |
| 98 | + 'component_ll':lg,'component_gain':l0-lg,'incremental_vs_v135':inc,'random_control_ll':lc,'gain_vs_random_control':causal, |
| 99 | + 'prior_coverage':float(GM.mean()),'folds_beating_v135':int(beats),'all_fold_nonregression':bool(all_nonreg),'folds':folds, |
| 100 | + 'decision':{'verdict':verdict,'next_action':next_action},'elapsed_seconds':float(time.time()-t0)} |
| 101 | + Path(a.out).write_text(json.dumps(out,indent=2));print('FINAL',json.dumps(out,indent=2),flush=True) |
| 102 | + np.savez_compressed(a.oof,y=y,sessions=sessions,objectives=obj,support=support,p_v97=P0,p_comp=P1,p_v135=P2,p_component=PG,p_random=PC,prior_gate=GM) |
| 103 | + |
| 104 | +if __name__=='__main__': |
| 105 | + p=argparse.ArgumentParser();p.add_argument('--features',type=Path,required=True);p.add_argument('--labels',type=Path,required=True);p.add_argument('--transcripts',type=Path,required=True);p.add_argument('--out',type=Path,default=Path('v139_component_applicability.json'));p.add_argument('--oof',type=Path,default=Path('v139_component_oof.npz'));main(p.parse_args()) |
0 commit comments