linear_attention#

Modules

modelopt.torch.quantization.linear_attention.config

Saved execution policy for GDN training-time numerical emulation.

modelopt.torch.quantization.linear_attention.decode

Explicit token-state and encoded-update replay references for QAT.

modelopt.torch.quantization.linear_attention.decode_prefill

Differentiable explicit per-sequence prefill/decode phase handoff.

modelopt.torch.quantization.linear_attention.kda

Differentiable KDA prefill with stable per-channel decay interactions.

modelopt.torch.quantization.linear_attention.prefill

Batched differentiable GDN prefill with materialized numerical boundaries.

modelopt.torch.quantization.linear_attention.utils

Shared helpers for linear-attention quantization.

Numerical policies and differentiable kernels for linear attention.