AIGC 开源一周|版本发布走向硬件、缓存与动态调度协同
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
01 AIGC PERFORMANCE ENGINEERING
AIGCage,中文名「AI生成时代」,专注生成式 AI 的性能工程、算法原理与底层优化,覆盖系统调度、分布式编排、GPU Kernel,以及可验证的性能数据。
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
02 LIVE BENCHMARK
VisionArena-Bench v0.1 · train[0:500] · Steady state · 20 excluded warmup requests
03 RECENT UPDATES
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
行业动态 · 来源整理8 月 18 日到 25 日,论文把推理优化推进到状态管理:MoE 专家驻留、KV page 压缩、speculative decoding 候选相关性、异步 Agent RL 与 CPU/ANE 带宽协同成为共同主线。
论文周报 · 来源整理8 月 11 日到 17 日,vLLM、FlashInfer、FlashAttention 4、Transformer Engine 和 ComfyUI 集中处理 MoE serving、FP4/FP8、MLA、KV 布局、动态 shape 与视频工作流兼容性。
行业动态 · 来源整理8 月 11 日到 17 日,论文把推理优化从单点算子扩展到权重驻留、输入自适应计算、KV Cache、Agent 回滚和跨节点迁移,运行时状态成为新的系统接口。
论文周报 · 来源整理从框架异步流水、micro-batch 重排到 tile-level 算子融合,系统梳理大模型训练和推理中的通信—计算协同,并区分资源卸载、GPU 发起通信与网内计算的真实边界。
工程手记 · 完整正文本周开源社区围绕 Kimi K3、混合注意力、长上下文和视频生成同步推进模型支持、Rust 前端、KV Cache、Kernel、量化与工作流工具。
行业动态 · 来源整理04 DAILY RESEARCH INDEX
按研究方向查看最新论文,先读摘要和分类,再决定今天要深入哪几篇。
打开每日论文 →Reflection with Action-Induced Visual Differences for Desktop GUI Agents
02Distillation 进展2026-08-25RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges
03Generative RL 进展2026-08-25Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
04LLM 理论进展2026-08-25Relative Time Intervals Representation for Word-level Timestamping with Masked Training
05 TRAINING LAB