linear_attention#

Modules

modelopt.torch.quantization.linear_attention.config

Saved execution policy for GDN training-time numerical emulation.

modelopt.torch.quantization.linear_attention.decode

Explicit token-state and encoded-update replay references for QAT.

modelopt.torch.quantization.linear_attention.decode_prefill

Differentiable explicit per-sequence prefill/decode phase handoff.

modelopt.torch.quantization.linear_attention.kda

Differentiable KDA prefill with stable per-channel decay interactions.

modelopt.torch.quantization.linear_attention.matmul

Operand QDQ and explicit arithmetic schedules for linear-attention matmuls.

modelopt.torch.quantization.linear_attention.prefill

Batched differentiable GDN prefill with materialized numerical boundaries.

modelopt.torch.quantization.linear_attention.reference

Small differentiable oracles, independent of FLA and Triton.

modelopt.torch.quantization.linear_attention.solve

Explicit triangular inverse policies for differentiable prefill emulation.

modelopt.torch.quantization.linear_attention.validation

Capabilities of the initial fused GDN fake-quant path.

Numerical policies and differentiable references for linear attention.