Logo
Explore Help
Register Sign In
wassname/vllm
Watch 1
Star 0
Fork 0
mirror of https://github.com/wassname/vllm.git synced 2026-07-21 12:50:05 +08:00
Code Issues Packages Projects Releases Wiki Activity
Files
37ca5581039271d4bf69e5cb1f1ec8e04775777c
vllm/vllm/model_executor
T
History
Woosuk KwonGitHubChen ShenAntoni Baum
37ca558103 Optimize model execution with CUDA graph (#1926)
Co-authored-by: Chen Shen <scv119@gmail.com>
Co-authored-by: Antoni Baum <antoni.baum@protonmail.com>
2023-12-16 21:12:08 -08:00
..
layers
Optimize model execution with CUDA graph (#1926)
2023-12-16 21:12:08 -08:00
models
Optimize model execution with CUDA graph (#1926)
2023-12-16 21:12:08 -08:00
parallel_utils
Optimize model execution with CUDA graph (#1926)
2023-12-16 21:12:08 -08:00
__init__.py
Refactor Worker & InputMetadata (#1843)
2023-11-29 22:16:37 -08:00
input_metadata.py
Optimize model execution with CUDA graph (#1926)
2023-12-16 21:12:08 -08:00
model_loader.py
Implement lazy model loader (#2044)
2023-12-12 22:21:45 -08:00
sampling_metadata.py
Refactor Worker & InputMetadata (#1843)
2023-11-29 22:16:37 -08:00
utils.py
TP/quantization/weight loading refactor part 2 - Refactor quantized linear logic and extend quantization support to all models (#1622)
2023-11-15 22:50:41 -08:00
weight_utils.py
Simplify weight loading logic (#2133)
2023-12-16 12:41:23 -08:00
Powered by Gitea Version: 1.27.0 Page: 31ms Template: 3ms
Auto
English
Bahasa Indonesia Deutsch English Español Français Gaeilge Italiano Latviešu Magyar nyelv Nederlands Polski Português de Portugal Português do Brasil Suomi Svenska Türkçe Čeština Ελληνικά Български Русский Українська فارسی മലയാളം 日本語 简体中文 繁體中文(台灣) 繁體中文(香港) 한국어
Licenses API