-
Notifications
You must be signed in to change notification settings - Fork 15
Expand file tree
/
Copy pathapi.yaml
More file actions
387 lines (341 loc) · 11.7 KB
/
Copy pathapi.yaml
File metadata and controls
387 lines (341 loc) · 11.7 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
name: ml4t-engineer
version: 1.0.0
python_requires: ">=3.12,<3.15"
description: High-performance feature engineering for financial machine learning
modules:
- path: ml4t.engineer
description: Main entry point
functions:
- name: compute_features
signature: "(data: pl.DataFrame, features: list[str] | list[dict] | Path) -> pl.DataFrame"
description: Compute technical indicators on OHLCV data
params:
- name: data
type: polars.DataFrame
required: true
schema:
columns: [open, high, low, close, volume]
- name: features
type: list[str] | list[dict] | Path
required: true
description: Feature specifications (names, dicts with params, or YAML path)
returns:
type: polars.DataFrame
description: Original data with feature columns appended
errors:
- type: ValueError
condition: "Unknown feature name"
message: "Feature '{name}' not found. Use list_features() to see available."
- type: ValueError
condition: "Missing required columns"
message: "DataFrame missing required columns: {columns}"
example: |
from ml4t.engineer import compute_features
result = compute_features(df, ["rsi", "macd", "atr"])
- name: list_features
signature: "(category: str | None = None) -> list[str]"
description: List available features, optionally filtered by category
params:
- name: category
type: str | None
required: false
description: Filter by category (momentum, trend, volatility, etc.)
returns:
type: list[str]
description: Sorted list of feature names
example: |
from ml4t.engineer import list_features
all_features = list_features()
momentum = list_features("momentum")
- name: list_categories
signature: "() -> list[str]"
description: List available feature categories
returns:
type: list[str]
description: Sorted list of category names
example: |
from ml4t.engineer import list_categories
categories = list_categories()
# ['math', 'microstructure', 'ml', 'momentum', ...]
- name: describe_feature
signature: "(name: str) -> dict[str, Any]"
description: Get detailed metadata about a feature
params:
- name: name
type: str
required: true
returns:
type: dict
description: Feature metadata (description, parameters, formula, etc.)
errors:
- type: ValueError
condition: "Feature not found"
example: |
from ml4t.engineer import describe_feature
info = describe_feature("rsi")
- path: ml4t.engineer.labeling
description: Label generation for supervised learning
functions:
- name: triple_barrier_labels
signature: "(data: pl.DataFrame, upper_barrier: float, lower_barrier: float, max_holding: int) -> pl.Series"
description: Triple-barrier labeling method from AFML
params:
- name: data
type: polars.DataFrame
required: true
- name: upper_barrier
type: float
required: true
description: Upper profit target (e.g., 0.02 for 2%)
- name: lower_barrier
type: float
required: true
description: Lower stop loss (e.g., 0.01 for 1%)
- name: max_holding
type: int
required: true
description: Maximum holding period in bars
returns:
type: polars.Series
description: Labels (1=upper hit, -1=lower hit, 0=timeout)
example: |
from ml4t.engineer.labeling import triple_barrier_labels
labels = triple_barrier_labels(df, 0.02, 0.01, 20)
- name: atr_barriers
signature: "(data: pl.DataFrame, atr_period: int, upper_multiplier: float, lower_multiplier: float, max_holding: int) -> pl.Series"
description: Triple-barrier with ATR-based dynamic barriers
params:
- name: atr_period
type: int
default: 14
- name: upper_multiplier
type: float
default: 2.0
- name: lower_multiplier
type: float
default: 1.0
- name: max_holding
type: int
required: true
returns:
type: polars.Series
description: Labels (1=upper hit, -1=lower hit, 0=timeout)
- path: ml4t.engineer.bars
description: Alternative bar sampling
functions:
- name: volume_bars
signature: "(data: pl.DataFrame, volume_threshold: float) -> pl.DataFrame"
description: Sample bars with equal volume per bar
params:
- name: volume_threshold
type: float
required: true
description: Volume per bar
- name: dollar_bars
signature: "(data: pl.DataFrame, dollar_threshold: float) -> pl.DataFrame"
description: Sample bars with equal dollar volume per bar
- name: tick_imbalance_bars
signature: "(data: pl.DataFrame, expected_imbalance: float) -> pl.DataFrame"
description: Information-driven bar sampling
- path: ml4t.engineer.preprocessing
description: Leakage-safe preprocessing
classes:
- name: Preprocessor
description: Pipeline of preprocessing steps
methods:
- name: fit_transform
signature: "(X: pl.DataFrame) -> pl.DataFrame"
- name: transform
signature: "(X: pl.DataFrame) -> pl.DataFrame"
- name: StandardScaler
description: Zero mean, unit variance scaling
- name: RobustScaler
description: Robust scaling using median and IQR
- name: MinMaxScaler
description: Scale to [0, 1] range
catalog:
features:
momentum:
- name: rsi
usage: "rsi"
params:
period: {type: int, default: 14, range: [2, 100]}
description: "Relative Strength Index (0-100)"
ta_lib: true
- name: macd
usage: "macd"
params:
fast: {type: int, default: 12}
slow: {type: int, default: 26}
signal: {type: int, default: 9}
description: "Moving Average Convergence/Divergence"
ta_lib: true
- name: stoch
usage: "stoch"
params:
fastk_period: {type: int, default: 14}
slowk_period: {type: int, default: 3}
slowd_period: {type: int, default: 3}
description: "Stochastic Oscillator"
ta_lib: true
- name: cci
usage: "cci"
params:
period: {type: int, default: 14}
description: "Commodity Channel Index"
ta_lib: true
- name: adx
usage: "adx"
params:
period: {type: int, default: 14}
description: "Average Directional Index (0-100)"
ta_lib: true
- name: mfi
usage: "mfi"
params:
period: {type: int, default: 14}
description: "Money Flow Index (0-100)"
ta_lib: true
trend:
- name: sma
usage: "sma"
params:
period: {type: int, default: 20, range: [1, 500]}
description: "Simple Moving Average"
ta_lib: true
- name: ema
usage: "ema"
params:
period: {type: int, default: 20}
description: "Exponential Moving Average"
ta_lib: true
- name: wma
usage: "wma"
params:
period: {type: int, default: 20}
description: "Weighted Moving Average"
ta_lib: true
- name: kama
usage: "kama"
params:
period: {type: int, default: 30}
description: "Kaufman Adaptive Moving Average"
ta_lib: true
volatility:
- name: atr
usage: "atr"
params:
period: {type: int, default: 14}
description: "Average True Range"
ta_lib: true
- name: natr
usage: "natr"
params:
period: {type: int, default: 14}
description: "Normalized ATR (percentage)"
ta_lib: true
- name: bollinger_bands
usage: "bollinger_bands"
params:
period: {type: int, default: 20}
std_dev: {type: float, default: 2.0}
description: "Bollinger Bands (upper, middle, lower)"
ta_lib: true
- name: yang_zhang
usage: "yang_zhang"
params:
window: {type: int, default: 20}
description: "Yang-Zhang volatility (most efficient estimator)"
- name: parkinson
usage: "parkinson"
params:
window: {type: int, default: 20}
description: "Parkinson high-low volatility"
- name: garman_klass
usage: "garman_klass"
params:
window: {type: int, default: 20}
description: "Garman-Klass OHLC volatility"
- name: realized
usage: "realized"
params:
window: {type: int, default: 20}
description: "Realized volatility (squared returns)"
volume:
- name: obv
usage: "obv"
description: "On Balance Volume"
ta_lib: true
- name: ad
usage: "ad"
description: "Accumulation/Distribution"
ta_lib: true
- name: adosc
usage: "adosc"
params:
fast: {type: int, default: 3}
slow: {type: int, default: 10}
description: "A/D Oscillator"
ta_lib: true
microstructure:
- name: kyle_lambda
usage: "kyle_lambda"
params:
window: {type: int, default: 20}
description: "Kyle's Lambda (price impact coefficient)"
- name: amihud_illiquidity
usage: "amihud_illiquidity"
params:
window: {type: int, default: 20}
description: "Amihud illiquidity ratio"
- name: vpin
usage: "vpin"
params:
volume_bucket_size: {type: int, default: 1000}
n_buckets: {type: int, default: 50}
description: "Volume-Synchronized Probability of Informed Trading"
- name: roll_spread
usage: "roll_spread"
params:
window: {type: int, default: 20}
description: "Roll implied bid-ask spread"
ml:
- name: fractional_diff
usage: "fractional_diff"
params:
d: {type: float, default: 0.4, range: [0, 1]}
threshold: {type: float, default: 1e-5}
description: "Fractionally differenced series"
- name: lag
usage: "lag"
params:
periods: {type: int, default: 1}
description: "Lagged values"
- name: rolling_stats
usage: "rolling_stats"
params:
window: {type: int, default: 20}
description: "Rolling statistics (mean, std, skew, kurtosis)"
- name: entropy
usage: "entropy"
params:
window: {type: int, default: 20}
description: "Shannon entropy"
- name: hurst
usage: "hurst"
params:
window: {type: int, default: 100}
description: "Hurst exponent (mean reversion indicator)"
errors:
- type: ValueError
message: "Feature '{name}' not found"
fix: "Use list_features() to see available features"
- type: ValueError
message: "DataFrame missing required columns: {columns}"
fix: "Ensure data has columns: open, high, low, close, volume"
- type: InsufficientDataError
message: "Need at least {required} rows, got {actual}"
fix: "Provide more historical data for the lookback period"
- type: InvalidParameterError
message: "Invalid value for {param}: {value}"
fix: "Check describe_feature() for valid parameter ranges"