## MultiLinear (`fwd_multi_linear`) Per-head batched matmul primitive required by MLA attention. **Spec:** [`doc/plans/engine-inference-core.md` § E2](https://github.com/tlkahn/mlxd/blob/main/doc/plans/engine-inference-core.md#stage-e-moe--hybrid-families-deepseek_v3v32v4-qwen3_5_moe-lfm2-nemotron_h) **Part of:** #105 (E2) · Epic: #56 ### Tasks - [ ] `fwd_multi_linear`: weight shape `[H, O, I]`, per-head batched matmul - [ ] Quantized variant via `mlx_quantized_matmul` with per-head scales/biases - [ ] Port semantics from mlx-lm `mla.py` `MultiLinear` / `QuantizedMultiLinear` - [ ] Unit tests on synthetic weights (bf16 + quantized) ### Notes - Consumed by MLA as `embed_q` and `unembed_out`
MultiLinear (
fwd_multi_linear)Per-head batched matmul primitive required by MLA attention.
Spec:
doc/plans/engine-inference-core.md§ E2Part of: #105 (E2) · Epic: #56
Tasks
fwd_multi_linear: weight shape[H, O, I], per-head batched matmulmlx_quantized_matmulwith per-head scales/biasesmla.pyMultiLinear/QuantizedMultiLinearNotes
embed_qandunembed_out