To kommandoer tar en Hugging Face-modell til C++-inferens
Hopp over ONNX-eksporten hvis målet er TensorRT-inferens inne i en C++-binær, men sjekk arkitekturkravet før du planlegger noe rundt det.
107 modellprofiler over 77 familier ligger i ytelsesmatrisen til TensorRT Model Connect, prosjektet NVIDIA har lagt ut på GitHub under Apache 2.0. To kommandoer er hele veien fra sjekkpunkt til kjørende inferens: trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6b.bundle og trtmc run ./qwen3-0.6b.bundle. Den vanlige ruten går fra PyTorch via ONNX eller TorchScript til TensorRT, og deretter til en integrasjon skrevet på nytt for hver modell.
Den arkitektoniske avgjørelsen ligger i .bundle-filen. Python eier oppslaget av sjekkpunktet og byggingen av TensorRT-motoren, mens kjøretiden er native C++ uten PyTorch i veien. Samme fil lastes fra C++ med trtmc::load(), og applikasjonen kaller oppgave-APIer som generate(), transcribe() og embed() i stedet for å vedlikeholde konverteringstrinn per modell. trtmc inspect viser hva bunten faktisk inneholder: modellfamilie, presisjon, kjøretidsidentitet og motorer.
Forbeholdene er reelle. Installasjonsdokumentasjonen oppgir at ferdige hjul bare finnes for Linux aarch64, med Python 3.10 eller 3.12, glibc 2.39 eller nyere og TensorRT 11.1.0.106. På x86_64 må du bygge fra kilde i Docker. Prosjektet har heller ingen tagget utgivelse: releasesiden i repoet inneholder nattbygg, og dokumentasjonens release-notat sier rett ut at ingen tagget utgivelse er publisert ennå.
Interessant for de som følger agentdrevet utvikling: repoet er selv bygget med kodeagenter. AGENTS.md registrerer Codex-skills gjennom en lokal marketplace-fil, forbyr direkte push til main og ber agenten eskalere til et menneske heller enn å svekke testkriterier for å få CI grønn. Der ligger også en instruks om å unngå ordet «Claude» i commit-meldinger, fordi repoets eget regelsett avviser dem.
Hva bør du gjøre?
- Sjekk arkitekturen først. Har du bare x86_64-maskiner, er kildebygg i Docker eneste vei inn, og da bør du regne inn den tiden før du lover noe.
- Kjør
trtmc inspectpå bunten før du legger den inn i en tjeneste. Det er den eneste måten å se hvilken TensorRT-kohort og hvilke motorer artefakten faktisk er låst til. - Vent på en tagget utgivelse før du standardiserer på formatet. Nattbygg mot et bunt-format uten versjonert utgivelseshistorikk er en dårlig kombinasjon i noe du skal drifte.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.