forked from vllm-project/vllm
-
Notifications
You must be signed in to change notification settings - Fork 0
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
Evaluate native IU4/IU8 WMMA for grouped-INT MoE prefill on gfx1151
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#31 In randomvariable/vllm;Track model-internal reasoning-state signals (attention, activations)
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#30 In randomvariable/vllm;Evaluate convergence-signal early exit for reasoning chains
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#29 In randomvariable/vllm;Reserve output budget for the answer so reasoning never exhausts max_tokens
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#28 In randomvariable/vllm;Reasoning-block marker penalty to reduce overthinking under quantized serving
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#27 In randomvariable/vllm;Restore sparse-MLA indexer decode on gfx1151
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#26 In randomvariable/vllm;Attention parity: run every attention type on the best available path on both targets
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#23 In randomvariable/vllm;Make memory admission and prefix caching hybrid-state aware
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#22 In randomvariable/vllm;Run an end-to-end gfx1151 serving qualification sweep
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#21 In randomvariable/vllm;Track upstream spec-decode and sparse-MLA performance stack
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#20 In randomvariable/vllm;Evaluate a load-aware speculative-depth governor
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#18 In randomvariable/vllm;Build a long-context KV policy evaluation harness
area/ideaOptimization idea candidate for evaluationOptimization idea candidate for evaluationStatus: Open.#17 In randomvariable/vllm;