Search: FP8
2 result(s) on page 1
flash-attention
Speed up long-sequence transformer training and inference.
quarantinedlinuxmacosOptimizationoptional- Registry
- optional
- Category
- MLOps
- Version
- 1.0.0
- Author
- Orchestra Research
- License
- MIT
curl -s /v1/skills/community__axehub:optional__optional__flash-attentiontensorrt-llm
High-throughput LLM inference on NVIDIA GPUs.
quarantinedlinuxmacosInference Servingoptional- Registry
- optional
- Category
- MLOps
- Version
- 1.0.0
- Author
- Orchestra Research
- License
- MIT
curl -s /v1/skills/community__axehub:optional__optional__tensorrt-llm