Supported Models#
The following is a table of supported models for the PyTorch backend:
Architecture |
Model |
HuggingFace Example |
|---|---|---|
|
Arcee Foundation MoE (Trinity) |
|
|
BART |
|
|
BERT-based |
|
|
Command A |
|
|
Nemotron |
|
|
DeepSeek V2 |
|
|
DeepSeek-V3, Kimi-K2 |
|
|
DeepSeek-V3.2 |
|
|
DeepSeek-V4 |
|
|
EXAONE 3.5 |
|
|
EXAONE 4.0 |
|
|
K-EXAONE |
|
|
Gemma 3 |
|
|
Gemma 3n |
|
|
Gemma 4 |
|
|
Gemma 4 12B Unified (encoder-free) |
|
|
Gemma 4 MTP assistant |
|
|
GLM-4.5, GLM-4.6, GLM-4.7 |
|
|
GLM-4.7-Flash |
|
|
GLM-5 |
|
|
Granite 3, Granite Guardian 3 |
|
|
Granite 4.0 Hybrid MoE |
|
|
GPT-OSS |
|
|
Hunyuan Dense |
|
|
Hunyuan MoE |
|
|
InternLM3 |
|
|
Kimi-K2.5 |
|
|
Laguna-XS |
|
|
Llama 3.1, Llama 3, Llama 2, LLaMA |
|
|
Llama 4 |
|
|
mBART |
|
|
MiniCPM-V 4.6 |
|
|
MiniMax M2/M2.1/M2.7 |
|
|
MiniMax-M3 |
|
|
Mistral |
|
|
Mixtral |
|
|
Llama 3.2 |
|
|
Nemotron-3, Nemotron-4, Minitron |
|
|
Nemotron-3-Nano, Nemotron-3-Super, Nemotron-3-Ultra |
|
|
NemotronNAS |
|
|
OLMo 3, OLMo 3.1 |
|
|
OpenELM |
|
|
Phi-4 |
|
|
QwQ, Qwen2 |
|
|
Qwen2-based |
|
|
Qwen2-based |
|
|
Qwen3 |
|
|
Qwen3-Embedding |
|
|
Qwen3MoE |
|
|
Qwen3Next |
|
|
Qwen3.5-MoE |
|
|
Seed OSS, Seed-Coder |
|
|
Skywork R1V2, Skywork SWE |
|
|
SmolLM3 |
|
|
Step-3.7-Flash |
|
|
T5, Flan-T5, ByT5 |
|
|
Whisper |
|
Model-Feature Support Matrix (Key Models)#
Note: Support for other models may vary. Features marked “N/A” are not applicable to the model architecture.
Model Architecture/Feature |
Overlap Scheduler |
CUDA Graph |
Attention Data Parallelism |
Disaggregated Serving |
Chunked Prefill |
MTP |
EAGLE-3 — Linear |
EAGLE-3 — Dynamic |
DFlash |
Torch Sampler |
TLLM C++ Sampler |
KV Cache Reuse |
Sliding Window Attention |
Logits Post Processor |
Guided Decoding |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
Yes |
Yes |
Yes |
Yes |
Yes [1] |
Yes |
No |
No |
No |
Yes |
Yes |
Yes [2] |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
No |
No |
Yes |
Yes |
Yes |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Yes |
Untested |
Yes |
Yes |
No |
No |
No |
Yes |
Yes |
Untested |
Yes |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Untested |
Yes |
Yes |
No |
No |
No |
Yes |
Yes |
Untested |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Yes |
Yes |
Yes |
No |
Yes |
Yes |
No |
Yes |
Yes |
Yes |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Yes |
Untested |
Yes |
No |
No |
No |
No |
Yes |
Yes |
No |
No |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
No |
No |
Yes |
Untested |
Yes |
N/A |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Yes |
Yes |
No |
Yes |
Yes |
No |
Yes |
Yes |
Untested |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Yes |
Yes |
Yes |
No |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
N/A |
Yes |
Yes |
|
Yes |
Yes |
Untested |
Untested |
Yes |
No |
No |
No |
No |
Yes |
Untested |
Untested |
N/A |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
No |
No |
Yes |
Yes |
Yes |
N/A |
Untested |
Untested |
|
Untested |
Yes |
Untested |
No |
Yes |
Yes |
No |
No |
No |
Yes |
Untested |
No |
Yes |
Untested |
Untested |
|
Untested |
Untested |
Untested |
No |
Yes |
No |
No |
No |
No |
Yes |
Untested |
No |
Yes |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Untested |
Untested |
Yes |
No |
No |
No |
Yes |
Untested |
Untested |
Yes |
Untested |
Untested |
|
Yes |
Yes |
Yes |
Untested |
Untested |
No |
No |
No |
No |
Yes |
Untested |
No |
N/A |
Untested |
Untested |
Encoder-Decoder Feature Support Matrix (PyTorch Backend)#
The following capabilities apply to the supported encoder-decoder architectures. For configuration guidance and limitations, see Use encoder-decoder models with the PyTorch backend.
Model Architecture/Feature |
Overlap Scheduler |
Decoder CUDA Graph |
Encoder CUDA Graph |
KV Cache Manager V1 |
KV Cache Manager V2 |
Beam Search |
Tensor Parallelism |
Pipeline Parallelism |
Chunked Prefill |
|---|---|---|---|---|---|---|---|---|---|
|
Yes |
Yes (except FP32) |
Yes |
Yes |
Yes (single beam) |
Yes (V1 only) |
Yes |
No |
No (encoder phase) |
|
Yes |
Yes (except FP32) |
Yes |
Yes |
Yes (single beam) |
Yes (V1 only) |
Yes |
No |
No (encoder phase) |
|
Yes |
Yes (except FP32) |
Yes |
Yes |
Yes (single beam) |
Yes (V1 only) |
Yes |
No |
No (encoder phase) |
|
Yes |
Yes (except FP32) |
No (feature inputs) |
Yes |
Yes (single beam) |
Yes (V1 only) |
Yes |
No |
No (encoder phase) |
Decoder CUDA graphs support greedy and beam-search decoding with KV cache manager V1 and single-beam decoding with
V2. Encoder CUDA graphs support the token-input BART, mBART, and T5 families; Whisper’s feature-driven audio encoder
runs eagerly. Use the TRTLLM attention backend for encoder-decoder models; tensor parallelism also requires attention
head counts divisible by the tensor parallel size. Chunked prefill is not supported for the encoder phase, so the
complete encoder input must fit in the iteration token budget.
Multimodal Feature Support Matrix (PyTorch Backend)#
Model Architecture/Feature |
Overlap Scheduler |
CUDA Graph |
Chunked Prefill |
Torch Sampler |
TLLM C++ Sampler |
KV Cache Reuse |
Logits Post Processor |
EPD Disaggregated Serving |
Modality |
|---|---|---|---|---|---|---|---|---|---|
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
L + I + V |
|
Yes |
Yes |
N/A |
Yes |
Yes |
N/A |
Yes |
No |
L + I |
|
Untested |
Yes |
Yes |
Yes |
Untested |
No |
Untested |
No |
L + I + V + A [9] |
|
Untested |
Untested |
Untested |
Yes |
Untested |
No |
Untested |
No |
L + I + A |
|
Yes |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
No |
L + I |
|
Yes |
Yes |
No |
Yes |
Yes |
No |
Yes |
No |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
L + I |
|
Yes |
Yes |
No |
Yes |
Yes |
No |
Yes |
No |
L + I |
|
Yes |
Untested |
Untested |
Yes |
Untested |
Untested |
Untested |
No |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
L + I |
|
Yes |
Yes |
Yes |
Yes |
Yes |
N/A |
Yes |
Yes |
L + I + V + A [10] |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
L + I + A |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
L + I + V |
|
Yes |
Yes |
Untested |
Yes |
Untested |
Untested |
Untested |
Untested |
L + I |
|
Yes |
Yes |
Untested |
Yes |
Untested |
No |
Untested |
Untested |
L + I + V |
|
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Untested |
Untested |
L + I + V |
|
Yes |
Yes |
Untested |
Yes |
Yes |
No |
Untested |
Yes |
L + I + V |
|
Yes |
Yes |
Untested |
Yes |
Yes |
No |
Untested |
Yes |
L + I + V |
Note:
L: Language
I: Image
V: Video
A: Audio
Multimodal Encoder Optimizations#
The following optimizations are available to models that implement
MultimodalModelMixin.
Model Architecture |
Multimodal Encoder Side Stream |
Multimodal Embeddings Cache |
|---|---|---|
|
Yes |
Yes |
|
Yes |
Yes |
|
Yes |
Yes |
|
Yes |
Yes |
|
Yes |
Yes |
|
Yes |
Yes |
|
Yes |
Yes |
Multimodal encoder side stream prefetches encoder work for pending requests on a separate CUDA stream, allowing it to overlap with work on the main stream. Set
multimodal_config.encoder_side_stream_max_aheadto a positive value to enable it; the value limits the number of prefetched requests that can be ahead of admission. This option is mutually exclusive withmultimodal_config.encoder_cuda_graphand can increase peak GPU memory use. It can be combined with the multimodal embeddings cache so side-stream cache hits skip encoder work and misses populate the cache.Multimodal embeddings cache is a per-model, cross-request LRU cache of encoder embeddings. Set
multimodal_config.encoder_cache_max_bytesto its capacity (for example,"512MiB"), or0to disable it. Entries are cached per multimodal item, but a request reuses cached embeddings only when all of its items hit the cache. At present, only single-modality requests are cacheable; mixed-modality requests bypass the cache. When combined with side-stream prefetch, peak memory is the cache capacity plus any in-flight prefetched encoder inputs and outputs.
Visual Generation Models#
TensorRT-LLM provides beta support for diffusion-based image and video generation. For full documentation, see the Visual Generation page.
Supported Models#
HuggingFace Model ID |
Tasks |
|---|---|
|
Text-to-Image |
|
Text-to-Image |
|
Text-to-Video |
|
Text-to-Video |
|
Image-to-Video |
|
Image-to-Video |
|
Text-to-Video |
|
Image-to-Video |
|
Text-to-Video, Image-to-Video |
|
Text-to-Video (with Audio), Image-to-Video (with Audio) |
|
Text-to-Image |
|
Text-to-Image |
|
Image-to-Image |
|
Image Editing (text+images-to-image) |
|
Text-to-Image, Text-to-Video, Image-to-Video |
|
Text-to-Image, Text-to-Video, Image-to-Video |
|
Text-to-Image (DMD2-distilled, fixed 4-step schedule) |
|
Image-to-Video (DMD2-distilled, fixed 4-step schedule) |
Feature Matrix#
Model |
FP8 blockwise |
NVFP4 |
TeaCache |
CFG Parallelism |
Ulysses Parallelism |
Parallel VAE |
CUDA Graph |
torch.compile |
trtllm-serve |
Attention2D |
Ring Attention |
Tensor Parallelism |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
FLUX.1 |
Yes |
Yes |
Yes |
No [1] |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
FLUX.2 |
Yes |
Yes |
Yes |
No [1] |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Wan 2.1 |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Wan 2.2 |
Yes |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
LTX-2 |
Yes |
Yes |
No |
Yes |
Yes |
No |
No |
Yes |
Yes |
Yes |
Yes |
No |
Qwen-Image |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
Qwen-Image-Layered [3] |
No |
No |
No |
No |
No |
No |
Yes |
Yes |
No |
No |
No |
No |
Qwen-Image-Edit-2511 |
Yes |
Yes |
No |
Yes |
No |
No |
Yes |
Yes |
No |
No |
No |
No |
Cosmos3 |
Yes |
Yes |
No |
Yes |
Yes |
Yes |
Yes |
Yes |
Yes |
No |
No |
Yes |