xinyun/vllm - vllm - 丝路新云-代码仓

mirror of https://git.datalinker.icu/vllm-project/vllm.git synced 2026-06-29 21:37:17 +08:00

Author	SHA1	Message	Date
Russell Bryant	790b79750b	[Build/CI] Fix env var typo (#15305 ) Signed-off-by: Russell Bryant <rbryant@redhat.com>	2025-03-21 22:28:46 +00:00
Nicolò Lucchesi	cfbb8c930f	[TPU][V1] MHA Pallas backend (#15288 ) Signed-off-by: NickLucche <nlucches@redhat.com>	2025-03-21 08:50:39 -07:00
Cyrus Leung	baec0d4de9	Revert "[Feature] specify model in config.yaml (#14855 )" (#15293 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2025-03-21 08:30:23 -07:00
Mengqing Cao	c21b99b912	[Bugfix][VLM] fix llava processor (#15285 ) Signed-off-by: Mengqing Cao <cmq0113@163.com>	2025-03-21 05:14:36 -07:00
Chen Zhang	93a00d7dde	[v1] Refactor KVCacheConfig (#14079 ) Signed-off-by: Chen Zhang <zhangch99@outlook.com>	2025-03-21 04:56:27 -07:00
Russell Bryant	61e8c18350	[Misc] Add cProfile helpers (#15074 ) Signed-off-by: Russell Bryant <rbryant@redhat.com>	2025-03-21 04:56:09 -07:00
Isotr0py	8afcd0f633	[Bugfix] Fix broken kernel test due to missing rename for v1 Triton backend (#15282 ) Signed-off-by: Isotr0py <2037008807@qq.com>	2025-03-21 11:42:06 +00:00
Lehua Ding	91ca929dc7	[V1] Fix wrong import path of get_flash_attn_version (#15280 ) Signed-off-by: Lehua Ding <lehuading@tencent.com>	2025-03-21 03:54:11 -07:00
Isotr0py	84e00adc8a	[Bugfix] Fix incorrect resolving order for transformers fallback (#15279 ) Signed-off-by: Isotr0py <2037008807@qq.com>	2025-03-21 03:54:08 -07:00
Isotr0py	47c7126213	[Misc] Add attention mask pre-computation optimization back to Qwen2.5-VL (#15273 ) Signed-off-by: Isotr0py <2037008807@qq.com>	2025-03-21 10:32:33 +00:00
Shanshan Shen	a989ca2bf6	[Bugfix] Add int8 torch dtype for KVCache (#15260 ) Signed-off-by: shen-shanshan <467638484@qq.com>	2025-03-21 08:58:28 +00:00
Wei Zeng	0fa3970deb	[Feature] specify model in config.yaml (#14855 ) Signed-off-by: weizeng <weizeng@roblox.com>	2025-03-21 00:26:03 -07:00
Nick Hill	da6ea29f7a	[V1] Avoid redundant input processing in n>1 case (#14985 ) Signed-off-by: Nick Hill <nhill@redhat.com>	2025-03-20 22:24:10 -07:00
Edwin Hernandez	7297941b38	[Doc] Update LWS docs (#15163 ) Signed-off-by: Edwinhr716 <Edandres249@gmail.com>	2025-03-20 21:18:47 -07:00
Isotr0py	f8a08cb90d	[V1] Enable Triton(ROCm) Attention backend for Nvidia GPUs (#14071 ) Signed-off-by: Isotr0py <2037008807@qq.com> Co-authored-by: Woosuk Kwon <woosuk.kwon@berkeley.edu>	2025-03-21 03:14:19 +00:00
Siyuan Liu	b15fd2be2a	[Hardware][TPU] Add check for no additional graph compilation during runtime (#14710 ) Signed-off-by: Siyuan Liu <lsiyuan@google.com>	2025-03-21 03:05:28 +00:00
Woosuk Kwon	e588ac237c	Add an example for reproducibility (#15262 ) Signed-off-by: Woosuk Kwon <woosuk.kwon@berkeley.edu>	2025-03-20 19:55:47 -07:00
Cody Yu	5df2da5b97	[Misc] Better RayExecutor and multiprocessing compatibility (#14705 ) Signed-off-by: Cody Yu <hao.yu.cody@gmail.com>	2025-03-20 19:27:46 -07:00
Woosuk Kwon	11b986b3fb	[Docs] Trim the latest news in README (#15261 ) Signed-off-by: Woosuk Kwon <woosuk.kwon@berkeley.edu>	2025-03-20 19:24:21 -07:00
Chih-Chieh Yang	296f927f24	[Model] RE: Mamba2 Prefill Performance Tweaks: Fixing Flurry of Unnecessary Memory Copies (#14857 ) Signed-off-by: Chih-Chieh-Yang <7364402+cyang49@users.noreply.github.com>	2025-03-20 19:21:08 -07:00
Travis Johnson	0032903a5b	[Bugfix] detect alibi and revert to FA2 (#15231 ) Signed-off-by: Travis Johnson <tsjohnso@us.ibm.com>	2025-03-20 19:20:16 -07:00
Hyesoo Yang	47195057e9	[V1][TPU] Speed up top-k on TPU by using torch.topk (#15242 ) Signed-off-by: Hyesoo Yang <hyeygit@gmail.com>	2025-03-20 19:19:40 -07:00
Harry Mellor	6edbfa924d	Mention `extra_body` as a way top pass vLLM only parameters using the OpenAI client (#15240 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2025-03-20 19:18:36 -07:00
Isotr0py	1e508343e1	[Bugfix] Fix incorrect qwen2.5-vl attention mask pre-computation (#15200 ) Signed-off-by: Isotr0py <2037008807@qq.com>	2025-03-20 19:18:04 -07:00
Sage Moore	2e0b4cfde0	[ROCM] Upgrade torch to 2.6 (#15244 ) Signed-off-by: Sage Moore <sage@neuralmagic.com>	2025-03-20 19:17:33 -07:00
Jee Jee Li	10f55fe6c5	[Misc] Clean up the BitsAndBytes arguments (#15140 ) Signed-off-by: Jee Jee Li <pandaleefree@gmail.com>	2025-03-20 19:17:12 -07:00
Lu Fang	d3ccbd6350	Fix CUDA kernel index data type in vllm/csrc/quantization/fused_kernels/layernorm_utils.cuh +10 (#15159 ) Signed-off-by: Lu Fang <lufang@fb.com> Co-authored-by: Richard Barnes <rbarnes@meta.com>	2025-03-21 10:01:11 +08:00
Varun Sundar Rabindranath	0cfe7d386d	[CI/Build] LoRA : make add_lora_test safer (#15181 ) Signed-off-by: Varun Sundar Rabindranath <varun@neuralmagic.com> Co-authored-by: Varun Sundar Rabindranath <varun@neuralmagic.com>	2025-03-21 09:28:53 +08:00
Woosuk Kwon	0c6f5023c3	[V1] Scheduler Refactoring [1/N] - Add Scheduler Interface (#15250 ) Signed-off-by: Woosuk Kwon <woosuk.kwon@berkeley.edu> Co-authored-by: Cody Yu <hao.yu.cody@gmail.com> Co-authored-by: Nick Hill <nhill@redhat.com>	2025-03-20 17:50:43 -07:00
Yu Chin Fabian Lim	06dd08256f	Enforce that TP > 1 is not supported for Mamba2 if Quantization is Enabled. (#14617 ) Signed-off-by: Yu Chin Fabian Lim <flim@sg.ibm.com>	2025-03-21 00:44:37 +00:00
Woosuk Kwon	2b22290ce0	[V1] Add flag to disable cascade attention (#15243 ) Signed-off-by: Woosuk Kwon <woosuk.kwon@berkeley.edu>	2025-03-20 15:24:16 -07:00
Jason	d8e82bc06d	[Bugfix] fix V1 Engine crash while handling requests with duplicate request id (#15043 ) Signed-off-by: Jiahui Sun <jhsun2020@gmail.com>	2025-03-20 10:01:02 -07:00
Chi Zhang	086b56824c	[ci] feat: make the test_torchrun_example run with tp=2, external_dp=2 (#15172 ) Signed-off-by: Chi Zhang <zhangchi.usc1992@bytedance.com> Signed-off-by: youkaichao <youkaichao@gmail.com> Co-authored-by: youkaichao <youkaichao@gmail.com>	2025-03-21 00:30:04 +08:00
Harry Mellor	5a0905ba2a	Replace `misc` issues with link to forum (#15226 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2025-03-20 23:18:20 +08:00
Richard Liu	a8f12a63fd	Fix env vars for running Ray distributed backend on GKE (#15166 ) Signed-off-by: Richard Liu <ricliu@google.com>	2025-03-20 14:59:33 +00:00
Harry Mellor	69ae2380c6	Add user forum to README (#15220 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2025-03-20 22:39:51 +08:00
Cyrus Leung	27261e40a6	[Bugfix] Multi-video inference on LLaVA-Onevision (#15082 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk> Co-authored-by: Isotr0py <2037008807@qq.com>	2025-03-20 14:10:45 +00:00
Quang-Linh LE	e3f813c33b	[macOS] Ugrade pytorch to 2.6.0 (#15129 )	2025-03-20 01:22:40 -07:00
Wang Ran (汪然)	c607a2652b	Fixing Imprecise Type Annotations (#15192 )	2025-03-20 01:19:55 -07:00
Kevin H. Luu	3d45e3d749	[release] Tag vllm-cpu with latest upon new version released (#15193 )	2025-03-20 01:19:10 -07:00
billishyahao	742369d35a	[Frontend][Bugfix] support prefill decode disaggregation on deepseek (#14824 ) Signed-off-by: billishyahao <bill.he@amd.com> Co-authored-by: Zhai Feiyue <80079571+ZhaiFeiyue@users.noreply.github.com>	2025-03-20 00:00:33 -07:00
Wang Ran (汪然)	bfe2fe0af4	typo: Update config.py (#15189 )	2025-03-19 23:31:21 -07:00
Matt Ritter	a8652f4f0f	Enable CUDA graph support for llama 3.2 vision (#14917 ) Signed-off-by: Matt Ritter <100659061+mritterfigma@users.noreply.github.com>	2025-03-19 23:29:16 -07:00
Cyrus Leung	2f726b241e	[Doc] Update README.md (#15187 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2025-03-20 13:25:58 +08:00
Mickaël Seznec	a597a57595	[Attention] Flash Attention 3 - fp8 (#14570 ) Signed-off-by: Mickael Seznec <mickael@mistral.ai>	2025-03-20 01:14:20 -04:00
Chauncey	ae65f3e237	[Misc]fixed disable these http request logs (#14754 ) Signed-off-by: chaunceyjiang <chaunceyjiang@gmail.com>	2025-03-19 21:53:40 -07:00
Roger Wang	34868b106a	[Doc] Update Mistral Small 3.1/Pixtral example (#15184 ) Signed-off-by: Roger Wang <ywang@roblox.com>	2025-03-20 04:46:06 +00:00
Russell Bryant	1f16b7fe74	[Core][V0] Add guidance backend for structured output (#14589 ) Signed-off-by: Russell Bryant <rbryant@redhat.com> Co-authored-by: Loc Huynh <lohuynh@microsoft.com> Co-authored-by: Michal Moskal <michal@moskal.me> Co-authored-by: Aaron Pham <contact@aarnphm.xyz>	2025-03-19 21:33:51 -07:00
Jennifer Zhao	b88be22165	[Benchmark] Allow oversample request in benchmark dataset (#15170 ) Signed-off-by: Jennifer Zhao <ai.jenniferzhao@gmail.com>	2025-03-20 12:32:58 +08:00
Nicolò Lucchesi	d8c6d7d6b5	[V1][TPU] Support V1 Sampler for ragged attention (#14227 ) Signed-off-by: NickLucche <nlucches@redhat.com>	2025-03-19 21:00:39 -07:00

... 13 14 15 16 17 ...

6026 Commits