정직한 선택 기준 최고가 113열 묶음의 승률 60.25%(누적 +703틱, n=1,497)로 이 저장소가 낸 정직 선택값 가운데 가장 높다. 그런데 앞선 트리와의 차이는 +0.27%p·McNemar p=0.8398 로 동급이고, 20분 모멘텀 규칙과는 +1.47%p·p=0.2801 로 못 넘었다. 이 실험이 실제로 얻은 것은 다른 자리다: 학습이 344행인 첫 폴드에서 64.61% — 같은 폴드의 신경망과 트리가 둘 다 53.93% 였다. 학습이 작을 때 이 모델을 쓴다는 가설(H22)이 짝지은 p=0.0066 으로 지지됐다.
가설과 결론
- 가설
- 선행 실험의 신경망 일곱 종이 가장 작은 학습 폴드에서 무너졌다 (학습 522행에서 48.09% — 동전 던지기보다 나쁘다). 수백~수천 행은 사전학습 표 트랜스포머가 맞추도록 합성 데이터로 사전학습된 크기다. 그러면 (H21) 학습 없이도 트리를 넘고, (H22) 그 이점이 초반 폴드에서 가장 크고, (H23) 문맥 앙상블을 키워도 값을 받지 못한다.
- 결론
- H21 부분 지지 — 네 묶음 중 수급 묶음 하나에서만 트리를 넘었다 (59.77% 대 56.78% · p=0.0308). 최고 승률이 나온 113열 묶음은 동급 이다. H22 지지 — 113열 묶음의 2019·2020 에서 신경망을 +10.7%p와 +4.9%p 앞서고 짝지어 p=0.0066 이다. H23 미판정 — 비용이 짝의 한쪽을 격자에서 떨어뜨렸다. 계약 판정은 폐기: 네 묶음 중 20분 모멘텀 규칙을 유의하게 넘은 것이 없어 채택할 후보가 없다.
- 이 실험이 바꾼 것
- 모델 축 하나다. 피처를 새로 만들지 않고 선행 실험의 캐시를 그대로 읽어, 데이터·폴드·채점·판정 문턱을 전부 같게 뒀다.
기호와 데이터
이 문서는 혼자 열린다. 쓰는 낱말을 여기서 정의한다.
- P_ref
- 채점 기준가. 15:45 동시호가 직전의 참조 가격이고 제출 시점에는 관측할 수 없다.
- P45
- 15:45 동시호가로 결정된 종가.
- ref_tick
P45와P_ref의 차이를 틱으로 센 값. 이 부호가 맞히려는 것이다.- 0틱
ref_tick = 0인 날. 방향이 없어 채점이 성립하지 않으므로 표본에서 뺀다(원시 2,394일 → 유효 1,847일).- 승률
- 예측 부호가
ref_tick부호와 같은 날의 비율. 전부 시험 구간에서만 센 값이다. - 워크포워드
- 연도 확장창. 시험연도 직전까지를 학습으로 쓰고 그 해만 시험한다. 학습이 해마다 자란다 — 344행에서 1,693행까지.
- 티어
- 피처 그룹의 묶음. 티어가 다르면 학습 시작연도와 시험 표본이 달라지므로 티어를 섞어 승률을 비교하지 않는다.
- 문맥 (in-context)
- 이 모델이 «학습» 대신 하는 것. 학습 표를 입력으로 받아 그 안의 규칙을 한 번의 순전파로 읽어낸다. 가중치가 갱신되지 않는다.
- 문맥 앙상블
- 같은 학습 표를 몇 가지 순열·전처리로 나눠 읽어 확률을 평균하는 횟수
(
n_estimators). 이 모델의 유일한 실질 축이다. - 정직 선택
- 설정을 직전 연도까지의 성적만 보고 고르는 절차. 이 실험은 설정이 하나라 아무것도 고르지 않았다 — 사후↔정직 간극이 0 인 것은 장점이 아니라 선택이 없었다는 뜻이다.
- spread_deploy
- 배포 형태의 시드 흔들림. 시드 열 개에서 크기 5짜리 부분집합 20개를 고정 난수로 뽑아 각 부분집합의 확률 평균으로 승률을 내고, 그 20개의 표준편차를 쓴다. 판정 문턱은 이 값의 2배다.
- e_규칙
- 기준선 하나 — 20분 모멘텀의 부호. 모델이 아니라 규칙이고 이 실험의 배포 관문이다.
- e_적응상수
- 기준선 하나 — 후행 120영업일의 다수 클래스.
| 원천 | 기간 | 해상도 | 행수 | 열수 | 결측 | 쓰임 |
|---|---|---|---|---|---|---|
3년 국채선물 근월 (g1_) | 2016-12-20 ~ 2026-09-18 | 1분봉 | 1,847 | 24 | 0.06% | 모멘텀·변동폭·위치. 봉 컷오프 15:34:00 |
10년선물·커브 (g1p_) | 같음 | 1분봉 | 1,847 | 6 | 0.11% | 장기 구간과의 관계 |
장중 투자자 수급 (g2_) | 2019-01-02 ~ 2026-09-18 | 30초 증분 | 1,847 | 28 | 19.98% | 수급 컷오프 15:34:00. 2017~18 이 전부 결측이라 이 그룹을 쓰는 묶음은 학습이 2019 부터다 |
일별·캘린더 (g6_) | 2016 ~ 2026-09-18 | 일별 | 1,847 | 37 | 0.60% | 전일까지만 쓴다 |
선물 일봉 전필드 (g7_) | 2016 ~ 2026-09-18 | 일별 종가 기준 | 1,847 | 48 | 0.21% | 전일 값만. 호가·베이시스·투자자 평균단가 |
한국은행 국고채 단순매입 (g8_) | 2019 ~ 2026-09-18 | 사건 | 1,847 | 6 | 66.60% | 공개시장운영 축. 결측이 커서 141열 묶음에서 8열이 분산 0 으로 떨어진다 |
| 표본 | 2016-12-20 ~ 2026-09-18 | 일별(라벨) | 1,847 | 204 | 원시 2,394일에서 장 이상일과 ref_tick = 0 인 날을 뺀 것 |
| 피처 묶음 | 그룹 | 선언 열 | 실측 열 | 학습 시작 | 학습 행 | 시험연도 | 시험 행 |
|---|---|---|---|---|---|---|---|
T0_core 봉·커브·일별달력 | g1_ g1p_ g6_ | 67 | 65 | 2017 | 344 → 1,693 | 2019~2026 | 1,497 |
T4_daily +일봉 전필드 | +g7_ | 115 | 113 | 2017 | 344 → 1,693 | 2019~2026 | 1,497 |
T1_flow34 +장중 수급 | +g2_ | 95 | 93 | 2019 | 361 → 1,349 | 2021~2026 | 1,136 |
T5_all 새 데이터 전부 | +g2_ g7_ g8_ | 149 | 141 | 2019 | 361 → 1,349 | 2021~2026 | 1,136 |
T4_daily
의 폴드 여덟 — 학습이 344행에서 1,693행으로 자란다. 막대 안 일수는 런이
직접 기록한 값이다. 이 그림의 첫 줄(학습 344행)이 H22 가 겨냥한
자리다.어떻게 쟀나
사전등록(protocol.md)을 결과 보기 전에 썼고 실행 뒤에 고치지
않았다. 판정 문턱 셋은 선행 실험과 같다.
| 조건 | 무엇 | 왜 |
|---|---|---|
| 승률 | 비교 대상을 넘는다 | 최소 조건 |
| 유의성 | 같은 시험일에 짝지은 McNemar 양측 p < 0.05 | 불일치 쌍 정확 이항검정. 승률이 높아도 유의하지 않으면 "차이가 있다" 고 쓰지 않는다 |
| 흔들림 | 차이 > spread_deploy × 2 | 배포하는 물건(확률 평균)이 시드를 바꾸면 얼마나 흔들리나 |
누설 가드를 둘 더했다. 문맥에 시험연도 행이 한 줄도 섞이지 않는다 — 이 모델은 학습 표를 입력으로 받으므로 거기 시험 행이 들어가면 그것이 곧 누설이고, 폴드를 자르는 코드는 선행 두 실험과 같은 여섯 줄이다. 그리고 사전학습 말뭉치와 우리 표본의 겹침은 확인할 수 없다 — 합성 데이터로 사전학습됐다고 보고돼 있고 우리 표는 비공개 단말·API 산출이라 겹칠 경로가 사실상 없으나, 확인 불가라는 사실을 적어 두고 결과가 지나치게 좋으면 이 항목을 먼저 의심한다.
돌린 모델 둘
돌린 모델 둘 — 같은 폴드에서
아래 그림은 모식도가 아니다. code/render_model8.py 가 T4_daily 시험 2026 폴드를 다시 적합해 커밋된 확률이 그대로 나오는지 확인한 뒤, 적합된 객체에서 읽은 값만으로 그린다(docs/AUTORESEARCH.md §1). 이 실험이 돌린 모델은 둘이고 둘 다 그린다(docs/REPORT_STYLE.md §2).
사전학습 표 트랜스포머 tabpfn#01
이 모델은 학습하지 않는다. 학습 표를 문맥으로 받아 시험 행을 바로 분류한다 — 경사하강이 돌지 않고 가중치가 한 개도 바뀌지 않는다. 우리가 흔들 수 있는 것은 «같은 표를 몇 가지 순열·전처리로 읽어 평균하나»(문맥 앙상블) 하나뿐이고, 라운드 0 의 비용 상한이 그 축을 1 로 묶었다.
| 모듈 종류 | 개수 |
|---|---|
Linear | 321 |
_DtypeMatchingRMSNorm | 142 |
GELU | 91 |
Sequential | 56 |
MLP | 35 |
SoftmaxScalingMLP | 28 |
ICLTransformerBlock | 24 |
ICLAttention | 24 |
CrossAttentionBlock | 6 |
CrossAttention | 6 |
LayerNorm | 3 |
ModuleList | 3 |
InducedSelfAttentionBlock | 3 |
TransformerBlock | 3 |
| 파라미터 합계 | 218,982,656 |
원장 대조 — 같은 파이프의 et_ref#00
앞선 실험이 고른 ExtraTrees 설정(400그루 · 깊이 6 · 잎 최소 20 · 분기 후보 √열)을 이 실험의 파이프와 폴드로 다시 돌린 것이다. 판정에 쓰지 않는다 — 앞선 실험의 숫자를 상수로만 믿지 않고 같은 자리에서 맞대 보려는 대조다.
| 분기 위치 \ 피처 | g6_is_auction_day | g1_pos_day | g1_pos_20m | g1_pos_60m | g6_dow | g6_prev_up | g6_dom | g6_is_roll_week | g6_days_to_expiry | g6_rate_CALL1일한은 | g6_rate_통안1년 | g6_dflow_증권선물순매수수량 | g6_rate_CD3개월 | g6_vol_60d | g1p_f10_ret_20m | g6_dflow_개인순매수수량 | g7_basis_모드듀레이션 | g7_basis_평균선도금리 | g1_ret_10m | g1p_curve_20m | g1_ma_dev_60m | g1_ret_20m | g1_ma_dev_20m | g7_flow_aggr_share_chg5 | g6_prev5_up | g1p_f10_ret_open | g1_ret_30m | g1p_f10_ret_5m | g7_basis_국채현물수익률 | g7_basis_저평가 | g6_dflow_은행순매수수량 | g1_ret_1m | g6_baserate_20d | g6_dflow_외국인합순매수수량 | g7_flow_value | g6_baserate_120d | g7_basis_이론갭 | g6_baserate_250d | g7_flow_aggr_share | g6_px_chg_20d | g1_ret_5m | g6_px_chg_60d | g1_ret_open | g1_vol_day | g7_basis_시장베이시스 | g1p_f10_ret_60m | g7_ktb_yield | g1_rng_60m | g1_vwap_dev | g1p_curve_60m | g6_is_auction_3y | g1_rng_20m | g6_baserate_60d | g1_ret_60m | g1_vol_last30_share | g1_ret_120m | g6_dflow_보험순매수수량 | g7_flow_trades | g1_rng_day | g6_prev_ref_tick | g6_dflow_투신순매수수량 | g6_vol_20d | g7_ob_cnt_ratio | g7_vol_chg5 | g7_vwap_gap_tick | g6_prev_abs_ref_tick | g7_basis_저평가_chg5 | g7_vol | g7_ktb_yield_chg5 | g7_vwap_gap_tick_chg5 | g6_prev_d_tick | g7_ob_cnt_ratio_chg5 | g1_oi_chg_day | g1_oi_chg_60m | g6_px_chg_5d | g1_vol_last5_share | g7_range | g7_basis_이론갭_chg5 | g7_basis_모드듀레이션_chg5 | g7_basis_평균선도금리_chg5 | g6_rate_통안1년_chg5d | g7_flow_value_chg5 | g7_basis_이론베이시스 | g7_range_chg5 | g7_oi_chg_chg5 | g7_basis_시장베이시스_chg5 | g1_gap_open | g7_basis_국채현물수익률_chg5 | g7_oi_chg | g7_invpx_투신 | g7_ob_qty_ratio | g7_invpx_투신_chg5 | g7_flow_trades_chg5 | g7_ob_qty_ratio_chg5 | g6_is_mpc_day | g7_invpx_보험 | g7_invpx_은행 | g7_ob_top5_ratio | g6_is_month_end | g7_invpx_증권/선물 | g7_invpx_보험_chg5 | g6_rate_CALL1일한은_chg5d | g7_basis_이론베이시스_chg5 | g7_invpx_외국인합_chg5 | g7_invpx_은행_chg5 | g7_ob_top5_ratio_chg5 | g7_invpx_증권/선물_chg5 | g6_rate_CD3개월_chg5d | g7_invpx_외국인합 | g7_invpx_연기금 | g6_is_quarter_end | g7_invpx_연기금_chg5 | g1_n_bars | 합 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 깊이 0 (뿌리) | 28 | 32 | 29 | 30 | 7 | 0 | 6 | 18 | 2 | 2 | 3 | 7 | 3 | 5 | 7 | 0 | 3 | 2 | 4 | 6 | 10 | 9 | 6 | 11 | 5 | 4 | 4 | 4 | 0 | 1 | 1 | 5 | 5 | 2 | 2 | 1 | 2 | 1 | 1 | 4 | 7 | 2 | 2 | 2 | 3 | 6 | 0 | 3 | 4 | 8 | 0 | 1 | 0 | 5 | 1 | 6 | 1 | 0 | 0 | 1 | 1 | 1 | 4 | 3 | 0 | 5 | 3 | 1 | 0 | 4 | 1 | 2 | 9 | 5 | 2 | 0 | 1 | 1 | 2 | 2 | 1 | 0 | 1 | 1 | 3 | 0 | 0 | 2 | 6 | 1 | 0 | 0 | 0 | 1 | 3 | 0 | 1 | 0 | 0 | 0 | 0 | 1 | 0 | 2 | 0 | 2 | 2 | 1 | 0 | 0 | 1 | 0 | 0 | 400 |
| 깊이 1 | 45 | 47 | 32 | 32 | 15 | 11 | 10 | 38 | 13 | 9 | 4 | 7 | 17 | 7 | 13 | 8 | 2 | 4 | 18 | 5 | 15 | 13 | 7 | 11 | 6 | 14 | 13 | 7 | 5 | 12 | 7 | 11 | 5 | 4 | 8 | 4 | 7 | 4 | 9 | 8 | 8 | 4 | 7 | 6 | 2 | 9 | 6 | 6 | 3 | 5 | 2 | 4 | 8 | 12 | 3 | 3 | 4 | 2 | 6 | 7 | 4 | 4 | 3 | 5 | 2 | 1 | 2 | 3 | 4 | 4 | 3 | 4 | 7 | 6 | 2 | 3 | 2 | 4 | 3 | 5 | 3 | 5 | 6 | 1 | 8 | 2 | 3 | 3 | 8 | 6 | 1 | 4 | 3 | 2 | 9 | 0 | 0 | 1 | 1 | 2 | 1 | 2 | 0 | 1 | 0 | 0 | 1 | 3 | 0 | 0 | 3 | 0 | 0 | 764 |
| 깊이 2 | 55 | 48 | 37 | 31 | 28 | 17 | 38 | 40 | 22 | 17 | 25 | 16 | 12 | 20 | 16 | 11 | 20 | 13 | 13 | 20 | 18 | 19 | 18 | 14 | 10 | 11 | 19 | 20 | 15 | 10 | 12 | 16 | 14 | 13 | 11 | 11 | 15 | 4 | 9 | 11 | 5 | 9 | 9 | 12 | 9 | 12 | 12 | 9 | 12 | 16 | 9 | 10 | 9 | 14 | 12 | 19 | 7 | 12 | 4 | 10 | 8 | 8 | 8 | 5 | 11 | 8 | 8 | 6 | 7 | 7 | 7 | 6 | 10 | 12 | 5 | 5 | 7 | 4 | 6 | 5 | 8 | 6 | 8 | 5 | 10 | 4 | 9 | 9 | 12 | 6 | 8 | 6 | 4 | 5 | 5 | 2 | 4 | 3 | 7 | 2 | 5 | 3 | 4 | 2 | 3 | 0 | 3 | 0 | 2 | 0 | 1 | 0 | 0 | 1,269 |
| 깊이 3 | 78 | 59 | 58 | 65 | 34 | 26 | 32 | 30 | 34 | 35 | 25 | 30 | 25 | 21 | 29 | 28 | 23 | 25 | 27 | 17 | 18 | 21 | 23 | 21 | 21 | 22 | 23 | 21 | 19 | 21 | 19 | 19 | 25 | 24 | 22 | 19 | 18 | 20 | 18 | 13 | 20 | 14 | 25 | 18 | 21 | 20 | 18 | 24 | 14 | 13 | 18 | 18 | 15 | 13 | 10 | 10 | 15 | 7 | 19 | 10 | 14 | 12 | 14 | 8 | 12 | 8 | 15 | 11 | 12 | 13 | 13 | 17 | 8 | 11 | 16 | 8 | 10 | 6 | 11 | 9 | 8 | 9 | 9 | 7 | 9 | 10 | 13 | 8 | 6 | 8 | 6 | 7 | 9 | 2 | 9 | 8 | 7 | 3 | 5 | 5 | 2 | 4 | 8 | 6 | 3 | 1 | 6 | 5 | 4 | 6 | 2 | 1 | 0 | 1,854 |
| 깊이 4 | 87 | 59 | 66 | 75 | 55 | 65 | 37 | 31 | 45 | 47 | 36 | 31 | 32 | 36 | 22 | 34 | 30 | 29 | 26 | 26 | 21 | 19 | 32 | 24 | 35 | 36 | 18 | 23 | 38 | 34 | 25 | 23 | 21 | 26 | 27 | 21 | 20 | 25 | 21 | 30 | 20 | 27 | 22 | 26 | 20 | 12 | 15 | 12 | 27 | 15 | 35 | 20 | 21 | 16 | 20 | 20 | 20 | 23 | 21 | 20 | 29 | 20 | 11 | 16 | 18 | 15 | 15 | 17 | 17 | 16 | 15 | 12 | 14 | 9 | 7 | 15 | 10 | 15 | 13 | 20 | 15 | 13 | 9 | 14 | 7 | 12 | 8 | 13 | 6 | 12 | 13 | 11 | 9 | 11 | 3 | 9 | 6 | 11 | 9 | 11 | 6 | 4 | 3 | 5 | 4 | 8 | 2 | 3 | 2 | 0 | 2 | 0 | 0 | 2,345 |
| 깊이 5 | 65 | 72 | 70 | 55 | 63 | 74 | 64 | 21 | 60 | 61 | 47 | 40 | 42 | 38 | 37 | 41 | 42 | 46 | 27 | 40 | 31 | 31 | 26 | 31 | 34 | 20 | 29 | 30 | 28 | 24 | 36 | 25 | 29 | 29 | 28 | 40 | 34 | 35 | 30 | 21 | 25 | 29 | 19 | 20 | 28 | 23 | 31 | 27 | 19 | 22 | 14 | 24 | 23 | 13 | 27 | 14 | 25 | 28 | 21 | 22 | 14 | 24 | 27 | 28 | 20 | 25 | 19 | 23 | 19 | 15 | 19 | 15 | 7 | 12 | 23 | 21 | 22 | 22 | 16 | 10 | 14 | 16 | 15 | 19 | 10 | 19 | 12 | 10 | 6 | 11 | 12 | 11 | 13 | 15 | 4 | 12 | 12 | 10 | 3 | 3 | 9 | 8 | 7 | 3 | 9 | 7 | 4 | 3 | 3 | 5 | 1 | 3 | 0 | 2,720 |
| 분기 합 | 358 | 317 | 292 | 288 | 202 | 193 | 187 | 178 | 176 | 171 | 140 | 131 | 131 | 127 | 124 | 122 | 120 | 119 | 115 | 114 | 113 | 112 | 112 | 112 | 111 | 107 | 106 | 105 | 105 | 102 | 100 | 99 | 99 | 98 | 98 | 96 | 96 | 89 | 88 | 87 | 85 | 85 | 84 | 84 | 83 | 82 | 82 | 81 | 79 | 79 | 78 | 77 | 76 | 73 | 73 | 72 | 72 | 72 | 71 | 70 | 70 | 69 | 67 | 65 | 63 | 62 | 62 | 61 | 59 | 59 | 58 | 56 | 55 | 55 | 55 | 52 | 52 | 52 | 51 | 51 | 49 | 49 | 48 | 47 | 47 | 47 | 45 | 45 | 44 | 44 | 40 | 39 | 38 | 36 | 33 | 31 | 30 | 28 | 25 | 23 | 23 | 22 | 22 | 19 | 19 | 18 | 18 | 15 | 11 | 11 | 10 | 4 | 0 | 9,352 |
깊이마다 어느 피처가 몇 번 갈랐나. 같은 폴드에서 TabPFN 은 이 표를 만들지 않는다 — 분기가 없다.
비용이 격자를 잘랐다
사전등록은 문맥 앙상블을 1·4·8·16·32 와 불균형 보정까지 설정 여섯으로 잡았다. 라운드 0 이 비용을 재서 그 중 다섯을 떨어뜨렸다 — 사전등록한 상한이 90초/적합이고, 넘으면 한 단계 줄이고 줄여도 넘으면 격자에서 뺀다는 규약이었다.
| 설정 | 문맥 앙상블 | 큰 폴드 | 판정 |
|---|---|---|---|
tabpfn#04 | 32 | 829.9초 | 한 단계(16) 529.0초도 초과 → 뺀다 |
tabpfn#03 | 16 | 529.0초 | 한 단계(8) 326.5초도 초과 → 뺀다 |
tabpfn#02 | 8 | 326.5초 | 한 단계(4) 188.0초도 초과 → 뺀다 |
tabpfn#05 | 8 + 보정 | 293.5초 | 한 단계(4) 초과 → 뺀다. 불균형 보정 축이 함께 떨어졌다 |
tabpfn#00 | 4 | 188.0초 | 한 단계 줄이면 #01 과 같아진다 |
tabpfn#01 | 1 | 50.2초 | 남는다 |
두 번째 관문도 같은 답을 냈다. 설정 여섯을 그대로 돌리면 직렬 117.4시간(시드 10)·58.7시간(시드 5)·35.2시간(시드 3)으로, 사전등록한 직렬 상한 12시간을 시드 사다리 끝에서도 3배 넘긴다. 비용 상한과 시드 사다리가 독립적으로 같은 결론에 이르렀다.
그래서 H23(문맥 앙상블 크기)은 미판정이다 — 짝의 양 끝이 같은 설정이 된다. 조용히 지우지 않고 미판정으로 남겼다. 그리고 설정이 하나면 «정직 선택» 이 아무것도 고르지 않는다: 사후↔정직 간극이 0 인 것은 장점이 아니라 선택이 없었다는 뜻이다. 다만 그 설정을 성능이 아니라 비용이 골랐으므로 이 승률에는 사후 정보가 섞이지 않았다 — 이 점은 강점이다.
결과 — 티어 넷
spread_deploy)이다. 113열 묶음에서 남색이
가장 높지만(0.6025) 옅은 주황(0.6059)이 그보다 위이고, 차이는 전부 문턱
안이다.| 티어 | n | TabPFN | 누적틱 | 선행 트리 정직 | 차 | 문턱 ±2σ | McNemar p (b:c) | 판정 |
|---|---|---|---|---|---|---|---|---|
T0_core | 1,497 | 0.5999 | +625 | 0.5905 | +0.0094 | 0.0085 | 0.3914 (122:108) | 미지지 |
T4_daily | 1,497 | 0.6025 | +703 | 0.5999 | +0.0027 | 0.0046 | 0.8398 (112:108) | 동급 |
T1_flow34 | 1,136 | 0.5977 | +567 | 0.5678 | +0.0299 | 0.0053 | 0.0308 | 지지 |
T5_all | 1,136 | 0.5898 | +533 | 0.5739 | +0.0158 | 0.0089 | 0.2473 | 미지지 |
T0_core 가 문턱 셋 중 둘(승률·흔들림)을 넘고 McNemar 에서만
걸렸다 — 예측이 갈린 230일이 122:108 이다. 사전등록 규율대로 "차이가 있다"
고 쓰지 않는다.
| 티어 | TabPFN | 누적틱 | 같은 파이프 ExtraTrees | 누적틱 | 차 | 비용 비 |
|---|---|---|---|---|---|---|
T0_core | 0.5999 | +625 | 0.6019 | +659 | −0.0020 | 53배 |
T4_daily | 0.6025 | +703 | 0.6059 | +683 | −0.0034 | 53배 |
T1_flow34 | 0.5977 | +567 | 0.5960 | +511 | +0.0017 | 53배 |
T5_all | 0.5898 | +533 | 0.5907 | +479 | −0.0009 | 53배 |
정직하게 읽으면 이것이 이 실험의 가장 불편한 표다. 고정 설정 트리가 네 티어 중 셋에서 더 높고, 차이는 전부 0.34%p 안이다 — 흔들림 문턱 안이므로 둘을 가르지 못했다고 읽어야 한다. 그리고 그 트리는 폴드당 0.6초다.
다만 두 숫자의 성질이 다르다. 옅은 주황은 «선행 실험이 18종에서 이 모델을 골랐다» 는 사후 정보를 쓴 고정 선택이라 정직한 숫자가 아니다. 남색의 설정은 비용이 골랐으므로 사후 정보가 없다. 같은 표에 놓고 "트리가 이겼다" 고 쓰면 그 비대칭을 숨기는 것이다.
초반 폴드 — 이 실험의 산출
| 티어 | 시험연도 | 학습 행 | TabPFN | 선행 신경망 | 차 | 짝 McNemar p (b:c) | 판정 |
|---|---|---|---|---|---|---|---|
T4_daily | 2019 | 344 | 0.6461 | 0.5393 | +0.1068 | 0.0066 (74:43) | 지지 |
| 2020 | 522 | 0.5301 | 0.4809 | +0.0492 | |||
T0_core | 2019 | 344 | 0.6124 | 0.5393 | +0.0731 | 0.1004 (42:27) | 부분 지지 |
| 2020 | 522 | 0.5246 | 0.4863 | +0.0383 |
수급을 쓰는 두 묶음은 시험이 2021 부터라 이 가설의 범위 밖이다 — 그 묶음에는 2019·2020 폴드가 없다.
또 규칙이다
| 티어 | TabPFN | e_규칙 | 차 | 문턱 ±2σ | McNemar p (b:c) | 넘었나 |
|---|---|---|---|---|---|---|
T0_core | 0.5999 | 0.5878 | +0.0120 | 0.0085 | 0.3690 (188:170) | 못 넘었다 |
T4_daily | 0.6025 | 0.5878 | +0.0147 | 0.0046 | 0.2801 (200:178) | 못 넘었다 |
T1_flow34 | 0.5977 | 0.5933 | +0.0044 | 0.0053 | 0.8250 | 못 넘었다 |
T5_all | 0.5898 | 0.5933 | −0.0035 | 0.0089 | 0.8677 | 못 넘었다 |
세 실험 연속 같은 자리에서 멈췄다. 트리(+1.21%p, 유의성 미검정) →
신경망(+0.26%p · p=0.9037) → 사전분포(+1.47%p · p=0.2801). 모델 축을 세 번
바꿨는데 20분 모멘텀 규칙을 유의하게 넘지 못했다. 남은 과제가 모델이 아닐 수
있다는 신호다 — T4_daily 에서 규칙과 갈린 378일이 200:178 이므로
«규칙이 이기는 날과 모델이 이기는 날이 갈리는가» 를 볼 재료는 있다.
| 티어 | spread_deploy | spread_seed | 선행 신경망의 spread_deploy |
|---|---|---|---|
T0_core | 0.0042 | 0.0044 | 0.0089 |
T4_daily | 0.0023 | 0.0068 | 0.0055 |
T1_flow34 | 0.0027 | 0.0074 | 0.0060 |
T5_all | 0.0045 | 0.0074 | 0.0086 |
실측 0.0023~0.0045 로 추정이 맞았다. 그래서 문턱이 선행 실험보다
좁아졌고, T0_core 가 승률·흔들림을 넘고도 McNemar 에서 걸린 것은
문턱이 느슨해서가 아니다. 적응상수 대비 McNemar p 는 0.0024~0.0533 으로
넷 중 셋에서 적응상수를 유의하게 넘는다.
한계
이 모델을 탐색하지 못했다. 비용 상한이 설정 여섯 중 다섯을 떨어뜨려 문맥을 한 번 읽는 설정만 돌렸다. 더 큰 문맥 앙상블이 더 좋을지 이 실험은 모른다(H23 미판정). 상한은 사전등록 값이라 사후에 올리지 않았다.
비용이 53배다. 같은 파이프의 400그루 ExtraTrees 가 폴드당 0.6초일 때 이 모델은 33.5초다. 사전등록 격자의 가장 비싼 설정은 큰 폴드에서 830초 (930배)였다.
비교 상수 하나가 코드와 어긋났다. 수급+전부 묶음의 선행 트리 값을 0.5766 으로 박았는데 코드의 재계산이 0.5739 를 냈다 — 사전등록은 절차 둘 중 큰 쪽을 쓰라 했고 코드는 하나만 쟀다. 어느 값으로도 판정이 미지지라 결론은 바뀌지 않지만, 코드가 사전등록을 덜 지킨 자리다.
H22 가 티어 하나에서만 유의하다. 113열 묶음은 p=0.0066 이지만 65열 묶음은 p=0.1004 로 «부분 지지» 다.
가중치를 외부에서 받았다. 이 저장소의 다른 모델은 전부 우리
데이터에서 적합된다. 판본(tabpfn-v3.5-20260909)을 런이 스스로
적는다. 사전학습 말뭉치와의 겹침은 확인할 수 없다.
GPU 가 없다(CPU 12스레드). 이 모델은 GPU 에서 비용 순위가 달라질 축이고, 그러면 H23 을 판정할 수 있다. 레짐별 분해는 하지 않았다. 캐파시티·비용 축은 비해당(방향 채점 게임 — 체결이 없다).
산출물
- 사전등록
protocol.md - 분석·판정
analysis.md - 정본 런
results/20260922_160905_pfn/ - 설정 격자·적합
code/pfnmodels.py - 비용 측정
run0.py - 그림
code/render_figures.py - 구조도
code/render_model8.py - 입력(선행 실험)
experiments/0005_flow_api_model_zoo/