Flash-Decoding

Flash-Decoding是一种针对长上下文推理的技术，可以显著加速推理中的注意力机制，从而使生成速度提高8倍。该技术通过并行加载键和值，然后分别重新缩放和组合结果来维护正确的注意力输出，从而实现了更快的推理速度。Flash-Decoding适用于大型语言模型，可以处理长文档、长对话或整个代码库等长上下文。Flash-Decoding已经在FlashAttention包和xFormers中提供，可以自动选择Flash-Decoding或FlashAttention方法，也可以使用高效的Triton内核。