Supported Models
This page is the model-support entry point. Use the table to find an exact Hugging Face checkpoint and TRTMC profile, then open Model Recipes to browse declared E2E recipes by task and model family.
The table below is rendered from website/data/model-support-matrix.md; the
project README links to this page instead of carrying a second copy. The docs
build resolves each row's TRTMC family from the exact matching E2E manifest
profile. Hugging Face model_type, architectures, and Diffusers
pipeline-class values come from the revision-pinned metadata snapshot in
website/data/hf-model-metadata.json; the same snapshot renders every family
recipe page.
How to read support
- A row applies only to its exact
hf_id, checkpoint resolution, TRTMC profile, and build configuration. model_typeidentifies the Hugging Face config family. Architecture names identify the checkpoint class or, for Diffusers checkpoints, the pipeline class. They are not interchangeable with the TRTMC family ID.- Architecture metadata describes the source checkpoint. The supported TRTMC task/head contract is shown separately and documented on the linked family page. It may intentionally consume only the base graph, such as an encoder that returns hidden states rather than a pretraining head.
- For a manifest without
hf_revision, the metadata snapshot SHA pins only the displayed configuration fields; it does not retroactively turn that unpinned recipe into an exact-revision support claim. - If a retained release row and the current manifest disagree on
hf_id, the table shows both values. The GB300 light remains attached to the release-row checkpoint; the current manifest value identifies today's declared CLI recipe. - Untested fine-tunes from the same family are best-effort compatible; they are not verified supported checkpoints.
- Platform specialization identifies a provider integration for an exact checkpoint or tuple. It does not replace native-runtime platform support.
- Performance color is evidence for the dated release comparison described below, not a blanket compatibility or correctness guarantee.
Release performance snapshot
This is the completed July 29, 2026 release comparison on NVIDIA GB300 at
source revision 508613d0bcc7003b123cf5be3d1b3f6e6c6cb667. It covers 105
unique single-process release profiles across 76 families. Distributed and L0
smoke profiles are outside this matrix.
Each light compares TRTMC inference p50 with the row's declared reference under matching workload, output, and timing contracts:
- 🟢 Green: TRTMC is more than 5% faster than the reference.
- 🟡 Yellow: TRTMC is within 5% of the reference.
- 🔴 Red: TRTMC is more than 5% slower than the reference.
- — Not supported: the profile is explicitly unsupported on that platform.
Bundle preparation, model loading, compilation when used, and warmup are
excluded from infer-p50 values. Baselines are declared per row and are not
uniformly torch.compile. See the
revision-matched comparison contract
and benchmark documentation
for reproduction and interpretation details.
| TRTMC family | HF model_type | HF architecture / pipeline class | TRTMC task/head contract | Hugging Face ID (hf_id, CLI input) | Checkpoint ID (TRTMC profile) | GB300 performance | Precision | Quantization | Optimized runtime dispatch |
|---|---|---|---|---|---|---|---|---|---|
albert | albert | AlbertForMaskedLMSource: config.architectures | encoder_only_nlp | albert/albert-base-v2Architecture metadata: config.json at 8e2f239c5f8a | albert-base | 🟢 Green | FP16 | None | No |
bert | bert | BertModelSource: config.architectures | encoder_only_nlp | sentence-transformers/all-MiniLM-L6-v2Architecture metadata: config.json at 1110a243fdf4 | all-minilm-l6-v2 | 🟢 Green | FP16 | None | No |
mpnet | mpnet | MPNetForMaskedLMSource: config.architectures | encoder_only_nlp | sentence-transformers/all-mpnet-base-v2Architecture metadata: config.json at e8c3b32edf54 | all-mpnet-base-v2 | 🟢 Green | FP16 | None | No |
bark | bark | BarkModelSource: config.architectures | text_to_audio | suno/barkArchitecture metadata: config.json at 70a8a7d34168 | bark-large | 🟢 Green | FP32 | None | No |
bark | bark | BarkModelSource: config.architectures | text_to_audio | suno/bark-smallArchitecture metadata: config.json at 1dbd7a128513 | bark-small | 🟢 Green | FP16 | None | No |
bart | bart | BartModelSource: config.architectures | text_generation_causal | facebook/bart-baseArchitecture metadata: config.json at aadd2ab0ae0c | bart-base | 🟢 Green | FP16 | None | No |
bert | bert | BertForMaskedLMSource: config.architectures | encoder_only_nlp | google-bert/bert-base-uncasedArchitecture metadata: config.json at 86b5e0934494 | bert-base-uncased | 🟢 Green | FP16 | None | No |
bert | bert | BertModelSource: config.architectures | encoder_only_nlp | BAAI/bge-small-en-v1.5Architecture metadata: config.json at 5c38ec7c405e | bge-small-en-v1.5 | 🟢 Green | FP16 | None | No |
bloom | bloom | BloomForCausalLMSource: config.architectures | text_generation_causal | bigscience/bloom-560mArchitecture metadata: config.json at ac2ae5fab2ce | bloom-560m | 🟢 Green | FP32 | None | No |
roberta | camembert | CamembertForMaskedLMSource: config.architectures | encoder_only_nlp | almanach/camembert-baseArchitecture metadata: config.json at a75967561c78 | camembert-base | 🟢 Green | FP16 | None | No |
canary | — | nemo.collections.asr.models.aed_multitask_models.EncDecMultiTaskModelSource: model_config.target | speech_to_text | nvidia/canary-1b-v2Architecture metadata: canary-1b-v2.nemo:model_config.yaml at 87bc52657add | canary-1b-v2 | 🟢 Green | FP16 | None | No |
chronos_bolt | t5 | ChronosBoltModelForForecastingSource: config.architectures | neural_operator | amazon/chronos-bolt-tinyArchitecture metadata: config.json at a0e552de8349 | chronos-bolt-tiny-official | 🟢 Green | FP32 | None | No |
codegen | codegen | CodeGenForCausalLMSource: config.architectures | text_generation_causal | Salesforce/codegen-350M-monoArchitecture metadata: config.json at d9107f71cca4 | codegen-350m | 🟢 Green | FP16 | None | No |
convbert | convbert | ConvBertModelSource: config.architectures | encoder_only_nlp | YituTech/conv-bert-baseArchitecture metadata: config.json at 5cb451936b5c | convbert-base | 🟢 Green | FP16 | None | No |
deberta | deberta | — Not declared by checkpoint metadata | encoder_only_nlp | microsoft/deberta-baseArchitecture metadata: config.json at 0d1b43ccf21b | deberta-base | 🟢 Green | FP16 | None | No |
deepseek_ocr | deepseek_vl_v2 | DeepseekOCR2ForCausalLMSource: config.architectures | vision_language_generation | deepseek-ai/DeepSeek-OCR-2Architecture metadata: config.json at aaa02f381194 | deepseek-ocr | 🟢 Green | FP16 FP32 layers: 6, 7, 8, 9, 10, 11, 12 | None | No |
deepseek_v2 | deepseek_v2 | DeepseekV2ForCausalLMSource: config.architectures | text_generation_causal | deepseek-ai/DeepSeek-V2-LiteArchitecture metadata: config.json at 604d5664dddd | deepseek-v2-lite | 🟢 Green | FP16 | None | No |
deepseek_v2 | deepseek_v3 | DeepseekV3ForCausalLMSource: config.architectures | text_generation_causal | yujiepan/deepseek-v3-tiny-randomCurrent manifest hf_id: katuni4ka/tiny-random-deepseek-v3Architecture metadata: config.json at cc35c93ec832 | deepseek-v2-tiny | 🟢 Green | FP16 | None | No |
distilbert | distilbert | DistilBertForMaskedLMSource: config.architectures | encoder_only_nlp | distilbert/distilbert-base-uncasedArchitecture metadata: config.json at 12040accade4 | distilbert-base-uncased | 🟢 Green | FP16 | None | No |
gpt2 | gpt2 | GPT2LMHeadModelSource: config.architectures | text_generation_causal | distilbert/distilgpt2Architecture metadata: config.json at 2290a62682d0 | distilgpt2 | 🟢 Green | FP16 | None | No |
dpr | dpr | DPRContextEncoderSource: config.architectures | encoder_only_nlp | facebook/dpr-ctx_encoder-single-nq-baseArchitecture metadata: config.json at bb21a3c2b165 | dpr-ctx-encoder | 🟢 Green | FP16 | None | No |
electra | electra | ElectraForPreTrainingSource: config.architectures | encoder_only_nlp | google/electra-base-discriminatorArchitecture metadata: config.json at 1ae76a97c7e8 | electra-base-discriminator | 🟢 Green | FP16 | None | No |
falcon | falcon | FalconForCausalLMSource: config.architectures | text_generation_causal | tiiuae/falcon-rw-1bArchitecture metadata: config.json at e4b9872bb803 | falcon-rw-1b | 🟢 Green | FP16 | None | No |
llama | llama | LlamaForCausalLMSource: config.architectures | text_generation_causal | tiiuae/Falcon3-1B-BaseArchitecture metadata: config.json at cb37ef3559b1 | falcon3-1b | 🟢 Green | FP16 | None | No |
flux | — | Flux2PipelineSource: model_index._class_name | diffusion_media_generation | black-forest-labs/FLUX.2-devArchitecture metadata: model_index.json at 26afe3a78bb2 | flux-2-dev | 🟢 Green | FP16 | None | No |
flux | — | Flux2PipelineSource: model_index._class_name | diffusion_media_generation | black-forest-labs/FLUX.2-devArchitecture metadata: model_index.json at 26afe3a78bb2 | flux-2-dev-fp8 | 🟢 Green | FP16 | fp8_scales=data/flux2-fp8-scales.json | No |
flux | — | FluxPipelineSource: model_index._class_name | diffusion_media_generation | black-forest-labs/FLUX.1-schnellArchitecture metadata: model_index.json at 741f7c3ce8b3 | flux-schnell | 🟢 Green | FP16 | None | No |
fnet | fnet | FNetForPreTrainingSource: config.architectures | encoder_only_nlp | google/fnet-baseArchitecture metadata: config.json at d89b6fad3cf5 | fnet-base | 🟢 Green | FP16 | None | No |
gemma | gemma2 | Gemma2ForCausalLMSource: config.architectures | text_generation_causal | google/gemma-2-2b-itArchitecture metadata: config.json at 299a8560bedf | gemma-2-2b | 🟢 Green | FP16 | None | No |
glm | glm | GlmForCausalLMSource: config.architectures | text_generation_causal | THUDM/glm-4-9b-hfArchitecture metadata: config.json at b44e98fcc8df | glm-4-9b | 🟢 Green | FP16 | None | No |
gpt_neo | gpt_neo | GPTNeoForCausalLMSource: config.architectures | text_generation_causal | EleutherAI/gpt-neo-125mArchitecture metadata: config.json at 21def0189f57 | gpt-neo-125m | 🟢 Green | FP16 | None | No |
gpt_oss | gpt_oss | GptOssForCausalLMSource: config.architectures | text_generation_causal | openai/gpt-oss-20bArchitecture metadata: config.json at 6cee5e81ee83 | gpt-oss-20b | 🟢 Green | FP16 | None | No |
gpt2 | gpt2 | GPT2LMHeadModelSource: config.architectures | text_generation_causal | openai-community/gpt2Architecture metadata: config.json at 607a30d783df | gpt2-125m | 🟢 Green | FP32 | None | No |
granite | granite | GraniteForCausalLMSource: config.architectures | text_generation_causal | ibm-granite/granite-3.1-2b-baseArchitecture metadata: config.json at bcf4e33e7deb | granite-3.1-2b | 🟢 Green | FP16 | None | No |
internlm | internlm2 | InternLM2ForCausalLMSource: config.architectures | text_generation_causal | internlm/internlm2-math-plus-1_8bArchitecture metadata: config.json at 998dd540b927 | internlm2-1.8b | 🟢 Green | FP16 | None | No |
internvl | internvl | InternVLForConditionalGenerationSource: config.architectures | vision_language_generation | OpenGVLab/InternVL3-2B-hfArchitecture metadata: config.json at cb57a075cb75 | internvl3-2b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
internvl | internvl | InternVLForConditionalGenerationSource: config.architectures | vision_language_generation | OpenGVLab/InternVL3-8B-hfArchitecture metadata: config.json at 259a3b64a146 | internvl3-8b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
lance | — | LanceSource: config.model_name | vision_language_generation | bytedance-research/LanceArchitecture metadata: config.json at 739531575886 | lance-3b-x2t-image | 🟢 Green | BF16 | None | No |
locateanything | locateanything | LocateAnythingForConditionalGenerationSource: config.architectures | vision_language_generation | nvidia/LocateAnything-3BArchitecture metadata: config.json at c32291ca5e99 | locateanything-3b | 🟢 Green | FP16 | None | No |
magpie_tts | decoder_ce | nemo.collections.tts.models.magpietts.MagpieTTSModelSource: model_config.target | text_to_audio | nvidia/magpie_tts_multilingual_357mRevision: 34d7e40da85cabc97f92198889b65cea27bc7fd1Architecture metadata: magpie_tts_multilingual_357m.nemo:model_config.yaml at 34d7e40da85c | magpie-tts-357m | 🟢 Green | FP32 | None | No |
mamba | mamba | MambaForCausalLMSource: config.architectures | text_generation_causal | state-spaces/mamba-130m-hfArchitecture metadata: config.json at 1e76775f628f | mamba-130m | 🟢 Green | FP32 | None | No |
marian | marian | MarianMTModelSource: config.architectures | text_generation_causal | Helsinki-NLP/opus-mt-en-ruArchitecture metadata: config.json at bb09c99d1800 | marian-en-ru | 🟢 Green | FP16 | None | No |
llama | llama | LlamaForCausalLMSource: config.architectures | text_generation_causal | nvidia/Llama-3.1-Minitron-4B-Depth-BaseArchitecture metadata: config.json at 47f17b2c73bb | minitron-4b-depth | 🟢 Green | FP16 | None | No |
llama | llama | LlamaForCausalLMSource: config.architectures | text_generation_causal | nvidia/Llama-3.1-Minitron-4B-Width-BaseArchitecture metadata: config.json at 5205ef7d3620 | minitron-4b-width | 🟢 Green | FP32 (manifest default) | None | No |
mistral | mistral | MistralForCausalLMSource: config.architectures | text_generation_causal | mistralai/Mistral-7B-Instruct-v0.1Architecture metadata: config.json at ec5deb64f2c6 | mistral-7b | 🟢 Green | FP16 | None | No |
mixtral | mixtral | MixtralForCausalLMSource: config.architectures | text_generation_causal | ggml-org/stories15M_MOEArchitecture metadata: config.json at b6dd73749746 | mixtral-stories-15m | 🟢 Green | FP16 FP32 layers: 4 | None | No |
modernbert | modernbert | ModernBertForMaskedLMSource: config.architectures | encoder_only_nlp | answerdotai/ModernBERT-baseArchitecture metadata: config.json at 8949b909ec90 | modernbert-base | 🟢 Green | FP32 | None | No |
nemotron_speech_streaming | nemotron3_5_asr | Nemotron3_5AsrForRNNTSource: config.architectures | speech_to_text | nvidia/nemotron-3.5-asr-streaming-0.6bArchitecture metadata: config.json at 1c8deaecc64b | nemotron-3.5-asr-streaming-0.6b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
eagle_vlm | llama_nemotron_vl | LlamaNemotronVLModelSource: config.architectures | embedding | nvidia/llama-nemotron-embed-vl-1b-v2Architecture metadata: config.json at 582e3bf72aee | nemotron-embed-vl-1b-v2 | 🟢 Green | FP16 | None | No |
nemotron_h | nemotron_h | NemotronHForCausalLMSource: config.architectures | text_generation_causal | nvidia/NVIDIA-Nemotron-Nano-9B-v2Architecture metadata: config.json at 6533e8de2c68 | nemotron-h-nano-9b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
nemotron | nemotron | NemotronForCausalLMSource: config.architectures | text_generation_causal | nvidia/Nemotron-4-Mini-Hindi-4B-BaseArchitecture metadata: config.json at 05c6ef6d2dda | nemotron-hindi-4b | 🟢 Green | FP16 | None | No |
nemotron_labs_diffusion | nemotron_labs_diffusion | NemotronLabsDiffusionModelSource: config.architectures | text_generation_causal | nvidia/Nemotron-Labs-Diffusion-8BArchitecture metadata: config.json at 16c67f0560b9 | nemotron-labs-diffusion-8b | 🟢 Green | BF16 | None | No |
nemotron | nemotron | NemotronForCausalLMSource: config.architectures | text_generation_causal | nvidia/Nemotron-Mini-4B-InstructArchitecture metadata: config.json at 791833e92ebd | nemotron-mini-4b | 🟢 Green | FP16 | None | No |
llama | llama | LlamaForCausalLMSource: config.architectures | text_generation_causal | nvidia/Llama-3.1-Nemotron-Nano-4B-v1.1Architecture metadata: config.json at d552708a9d57 | nemotron-nano-4b | 🟢 Green | FP16 | None | No |
eagle_vlm | llama_nemotron_vl_rerank | LlamaNemotronVLForSequenceClassificationSource: config.architectures | reranking | nvidia/llama-nemotron-rerank-vl-1b-v2Architecture metadata: config.json at 9c20c4aedf9e | nemotron-rerank-vl-1b-v2 | 🟢 Green | FP16 | None | No |
nemotron_speech_streaming | nemotron_asr_streaming | NemotronAsrStreamingForRNNTSource: config.architectures | speech_to_text | nvidia/nemotron-speech-streaming-en-0.6bArchitecture metadata: config.json at ebe59e5a8171 | nemotron-speech-streaming-en-0.6b | 🟢 Green | FP16 | None | No |
m2m_100 | m2m_100 | M2M100ForConditionalGenerationSource: config.architectures | text_generation_causal | facebook/nllb-200-distilled-600MArchitecture metadata: config.json at f8d333a098d1 | nllb-200-distilled-600m | 🟢 Green | FP16 | None | No |
olmo | olmo | OlmoForCausalLMSource: config.architectures | text_generation_causal | allenai/OLMo-1B-hfArchitecture metadata: config.json at aee7752d9c08 | olmo-1b | 🟢 Green | FP16 | None | No |
olmo2 | olmo2 | Olmo2ForCausalLMSource: config.architectures | text_generation_causal | allenai/OLMo-2-0425-1BArchitecture metadata: config.json at a1847dff3500 | olmo2-1b | 🟢 Green | FP16 | None | No |
opt | opt | OPTForCausalLMSource: config.architectures | text_generation_causal | facebook/opt-125mArchitecture metadata: config.json at 27dcfa74d334 | opt-125m | 🟢 Green | FP16 | None | No |
bert | bert | BertModelSource: config.architectures | encoder_only_nlp | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Architecture metadata: config.json at e8f8c211226b | paraphrase-multilingual-minilm-l12-v2 | 🟢 Green | FP16 | None | No |
patchtsmixer | patchtsmixer | PatchTSMixerForPredictionSource: config.architectures | neural_operator | ibm-granite/granite-timeseries-patchtsmixerArchitecture metadata: config.json at 90dc5a88d45f | patchtsmixer-granite-official | 🟢 Green | FP16 | None | No |
patchtst | patchtst | PatchTSTForRegressionSource: config.architectures | neural_operator | ibm-research/patchtst-etth1-regression-distributionArchitecture metadata: config.json at d5ef731ed80f | patchtst-etth1-regression-distribution | 🟢 Green | FP16 FP32 layers: 5 | None | No |
patchtst | patchtst | PatchTSTForPredictionSource: config.architectures | neural_operator | ibm-granite/granite-timeseries-patchtstArchitecture metadata: config.json at 7fe295d8bc8f | patchtst-granite-official | 🟢 Green | FP16 | None | No |
personaplex | personaplex | — Not declared by checkpoint metadata | speech_to_speech | nvidia/personaplex-7b-v1Architecture metadata: config.json at fdaf4090a61c | personaplex-7b | 🟢 Green | FP16 FP32 layers: 0, 1 | None | No |
phi_moe | phimoe | PhiMoEForCausalLMSource: config.architectures | text_generation_causal | microsoft/Phi-tiny-MoE-instructArchitecture metadata: config.json at 2fe50e88d0e2 | phi-moe | 🟢 Green | FP16 | None | No |
phi | phi3 | Phi3ForCausalLMSource: config.architectures | text_generation_causal | microsoft/Phi-3-mini-4k-instructArchitecture metadata: config.json at f39ac1d28e92 | phi3-mini | 🟢 Green | FP16 | None | No |
phi4_multimodal | phi4mm | Phi4MMForCausalLMSource: config.architectures | vision_language_generation | microsoft/Phi-4-multimodal-instructArchitecture metadata: config.json at 93f923e1a772 | phi4-multimodal | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
pixart | — | PixArtSigmaPipelineSource: model_index._class_name | diffusion_media_generation | PixArt-alpha/PixArt-Sigma-XL-2-1024-MSArchitecture metadata: model_index.json at e102b3591cc8 | pixart-sigma-1024 | 🟢 Green | FP16 FP32 layers: 0 | None | No |
gpt_neox | gpt_neox | GPTNeoXForCausalLMSource: config.architectures | text_generation_causal | EleutherAI/pythia-70mArchitecture metadata: config.json at a39f36b100fe | pythia-70m | 🟢 Green | FP32 | None | No |
qwen_image | — | QwenImagePipelineSource: model_index._class_name | diffusion_media_generation | Qwen/Qwen-ImageArchitecture metadata: model_index.json at 75e0b4be04f6 | qwen-image | 🟢 Green | BF16 | None | No |
qwen_image | — | QwenImagePipelineSource: model_index._class_name | diffusion_media_generation | Qwen/Qwen-Image-2512Architecture metadata: model_index.json at 25468b98e327 | qwen-image-2512 | 🟢 Green | BF16 | None | No |
qwen_image | — | QwenImageEditPlusPipelineSource: model_index._class_name | diffusion_media_generation | Qwen/Qwen-Image-Edit-2511Architecture metadata: model_index.json at 6f3ccc0b56e4 | qwen-image-edit-2511 | 🟢 Green | BF16 | None | No |
qwen_vl | qwen2_5_vl | Qwen2_5_VLForConditionalGenerationSource: config.architectures | vision_language_generation | Qwen/Qwen2.5-VL-3B-InstructArchitecture metadata: config.json at 66285546d2b8 | qwen25vl-3b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
qwen | qwen3 | Qwen3ForCausalLMSource: config.architectures | text_generation_causal | Qwen/Qwen3-0.6BArchitecture metadata: config.json at c1899de289a0 | qwen3-0.6b-fp16 | 🟢 Green | FP16 | None | Yes TensorRT Edge-LLM Qualified TRTMC dispatch target: Linux x86_64, NVIDIA A100 80GB PCIe (SM80), FP16 Additional dispatch targets: Coming soon |
qwen | qwen3 | Qwen3ForCausalLMSource: config.architectures | text_generation_causal | Qwen/Qwen3-0.6BArchitecture metadata: config.json at c1899de289a0 | qwen3-0.6b-fp8 | 🟢 Green | BF16 | format=fp8 scale_source=modelopt calibration_samples=64 | Yes TensorRT Edge-LLM Qualified TRTMC dispatch target: Linux x86_64, NVIDIA A100 80GB PCIe (SM80), FP16 Additional dispatch targets: Coming soon |
qwen | qwen3 | Qwen3ForCausalLMSource: config.architectures | text_generation_causal | Qwen/Qwen3-0.6BArchitecture metadata: config.json at c1899de289a0 | qwen3-0.6b-topp | 🟢 Green | FP16 | None | Yes TensorRT Edge-LLM Qualified TRTMC dispatch target: Linux x86_64, NVIDIA A100 80GB PCIe (SM80), FP16 Additional dispatch targets: Coming soon |
qwen | qwen3 | Qwen3ForCausalLMSource: config.architectures | text_generation_causal | Qwen/Qwen3-4B-Instruct-2507Architecture metadata: config.json at cdbee75f17c0 | qwen3-4b-instruct-2507 | 🟢 Green | FP16 | None | Yes TensorRT Edge-LLM Qualified TRTMC dispatch target: Linux x86_64, NVIDIA A100 80GB PCIe (SM80), FP16 Additional dispatch targets: Coming soon |
qwen_moe | qwen3_moe | Qwen3MoeForCausalLMSource: config.architectures | text_generation_causal | Qwen/Qwen3-30B-A3BArchitecture metadata: config.json at ad44e777bcd1 | qwen3-moe-30b-a3b | 🟢 Green | FP16 | None | No |
qwen_moe | qwen3_moe | Qwen3MoeForCausalLMSource: config.architectures | text_generation_causal | amd-quark/tiny-random-qwen3_moeArchitecture metadata: config.json at ca2aaa9a82e9 | qwen3-moe-tiny-random | 🟢 Green | FP16 | None | No |
qwen3_omni | qwen3_omni_moe | Qwen3OmniMoeForConditionalGenerationSource: config.architectures | omni_multimodal | Qwen/Qwen3-Omni-30B-A3B-InstructArchitecture metadata: config.json at 26291f793822 | qwen3-omni-30b-a3b-instruct | 🔴 Red | BF16 | None | No |
qwen_vl | qwen3_vl | Qwen3VLForConditionalGenerationSource: config.architectures | vision_language_generation | Qwen/Qwen3-VL-2B-InstructArchitecture metadata: config.json at 89644892e4d8 | qwen3-vl-2b | 🟢 Green | FP16 FP32 layers: 0, 1, 2 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
qwen3_5 | qwen3_5 | Qwen3_5ForConditionalGenerationSource: config.architectures | text_generation_causal | Qwen/Qwen3.5-9BArchitecture metadata: config.json at c20223623576 | qwen35-9b | 🟢 Green | FP16 | None | Coming soon TensorRT Edge-LLM Qualified TRTMC dispatch target: Coming soon |
mistral | mistral | MistralForCausalLMSource: config.architectures | text_generation_causal | nvidia/Riva-Translate-4B-Instruct-v1.1Architecture metadata: config.json at 1eb944ce9f27 | riva-translate-4b | 🟢 Green | FP16 | None | No |
roberta | roberta | RobertaForMaskedLMSource: config.architectures | encoder_only_nlp | FacebookAI/roberta-baseArchitecture metadata: config.json at e2da8e2f811d | roberta-base | 🟢 Green | FP16 | None | No |
roberta | roberta | RobertaForMaskedLMSource: config.architectures | encoder_only_nlp | FacebookAI/roberta-largeArchitecture metadata: config.json at 722cf37b1afa | roberta-large | 🟢 Green | FP16 | None | No |
rwkv | rwkv | RwkvForCausalLMSource: config.architectures | text_generation_causal | RWKV/rwkv-4-169m-pileArchitecture metadata: config.json at 46bdc280eb97 | rwkv-169m | 🟢 Green | FP32 | None | No |
sam | sam | SamModelSource: config.architectures | prompted_segmentation | facebook/sam-vit-baseArchitecture metadata: config.json at 70c1a07f894e | sam-vit-base | 🟢 Green | FP16 | None | No |
sam3 | sam3_video | Sam3VideoModelSource: config.architectures | prompted_segmentation | facebook/sam3Architecture metadata: config.json at 3c879f39826c | sam3 | 🟢 Green | FP32 | None | No |
sana_wm | — | SanaMSVideoCamCtrl_1600M_P1_D20Source: config.model.model | diffusion_media_generation | Efficient-Large-Model/SANA-WM_bidirectionalArchitecture metadata: config.yaml at e96271d77398 | sana-wm-bidirectional | 🟡 Yellow | BF16 | None | No |
segformer | segformer | SegformerForSemanticSegmentationSource: config.architectures | segmentation | nvidia/segformer-b0-finetuned-ade-512-512Architecture metadata: config.json at 489d5cd81a0b | segformer-b0-ade | 🟢 Green | FP16 | None | No |
stablelm | stablelm | StableLmForCausalLMSource: config.architectures | text_generation_causal | stabilityai/stablelm-2-1_6bArchitecture metadata: config.json at f499ead74c53 | stablelm2-1.6b | 🟢 Green | FP16 | None | No |
starcoder2 | starcoder2 | Starcoder2ForCausalLMSource: config.architectures | text_generation_causal | bigcode/starcoder2-3bArchitecture metadata: config.json at 733247c55e3f | starcoder2-3b | 🟢 Green | FP16 | None | No |
t5 | t5 | T5ForConditionalGenerationSource: config.architectures | text_generation_causal | google-t5/t5-smallArchitecture metadata: config.json at df1b051c4962 | t5-small | 🟢 Green | FP16 | None | No |
timesfm | timesfm | TimesFmModelForPredictionSource: config.architectures | neural_operator | google/timesfm-2.0-500m-pytorchArchitecture metadata: config.json at dc2443792ce5 | timesfm-2.0-500m-official | 🟢 Green | FP32 | None | No |
timm_vit | — | vit_base_patch16_224Source: config.architecture | image_classification | timm/vit_base_patch16_224.augreg_in21k_ft_in1kArchitecture metadata: config.json at 2ec9fb3d7bb6 | timm-vit-base-p16-224-augreg-in21k-ft-in1k | 🟢 Green | FP16 | None | No |
llama | llama | LlamaForCausalLMSource: config.architectures | text_generation_causal | TinyLlama/TinyLlama-1.1B-Chat-v1.0Architecture metadata: config.json at fe8a4ea1ffed | tinyllama-1.1b | 🟢 Green | FP16 | None | No |
wan_t2v | — | WanPipelineSource: model_index._class_name | diffusion_media_generation | Wan-AI/Wan2.1-T2V-1.3B-DiffusersArchitecture metadata: model_index.json at 0fad780a534b | wan21-t2v-1.3b | 🟢 Green | FP16 FP32 layers: 24 | None | No |
wan2_2_ti2v | ti2v | WanModelSource: config._class_name | diffusion_media_generation | Wan-AI/Wan2.2-TI2V-5BRevision: 921dbaf3f1674a56f47e83fb80a34bac8a8f203eArchitecture metadata: config.json at 921dbaf3f167 | wan22-ti2v-5b | 🟢 Green | BF16 | None | No |
whisper | whisper | WhisperForConditionalGenerationSource: config.architectures | speech_to_text | openai/whisper-large-v3-turboArchitecture metadata: config.json at 41f01f3fe87f | whisper-large-v3-turbo | 🟢 Green | FP32 | None | No |
whisper | whisper | WhisperForConditionalGenerationSource: config.architectures | speech_to_text | openai/whisper-tinyArchitecture metadata: config.json at 169d4a4341b3 | whisper-tiny-fp16 | 🟢 Green | FP16 FP32 layers: 0 | None | No |
xglm | xglm | XGLMForCausalLMSource: config.architectures | text_generation_causal | facebook/xglm-564MArchitecture metadata: config.json at f3059f01b98c | xglm-564m | 🟢 Green | FP16 | None | No |
roberta | xlm-roberta | XLMRobertaForMaskedLMSource: config.architectures | encoder_only_nlp | FacebookAI/xlm-roberta-baseArchitecture metadata: config.json at e73636d4f797 | xlm-roberta-base | 🟢 Green | FP16 | None | No |
xlnet | xlnet | XLNetLMHeadModelSource: config.architectures | encoder_only_nlp | xlnet/xlnet-base-casedArchitecture metadata: config.json at ceaa69c7bc5e | xlnet-base | 🟢 Green | FP16 | None | No |
z_image | — | ZImagePipelineSource: model_index._class_name | diffusion_media_generation | Tongyi-MAI/Z-Image-TurboArchitecture metadata: model_index.json at f332072aa78b | z-image-turbo | 🔴 Red | FP16 FP32 layers: 2, 3, 4, 7, 8 | None | No |
Declared recipes beyond the release snapshot
The support table is a retained release snapshot. The current checkout may contain additional E2E manifests, L0 replacements, and distributed variants. Those declarations are available through Model Recipes, organized as Hugging Face task → model family → exact manifest recipe.
Platform specializations will roll out in phases aligned with model coverage available in TensorRT Edge-LLM and TensorRT-Model-Connect releases. Each batch must document the exact qualified model, target, precision, and configuration tuple.