REINFORCE 算法是最经典、最基础的 Policy Gradient(策略梯度)算法,由 Ronald J. Williams (1992) 提出,直接对策略建模,寻找到最优的策略使得总体回报的期望最高。在此基础上,在 REINFORCE 的梯度公式中,减去一个与动作无关的基线 b,可以在不引入偏差的情况下降低梯度方差,从而提升训练稳定性,并通常提高收敛效率。
Fast R-CNN 在 R-CNN 的基础上,通过 CNN 对全图提取特征,同时保留了 Selective Search 在原图生成 RoI 的过程,通过特征映射将原图的 RoI 映射到特征图上,最后通过 RoI Pooling 得到固定的尺寸,方便后续的分类和回归计算。纵观整个过程,Proposal Region 的特征计算只需要一次 CNN 计算加上特征映射就能完整,同时,摒弃掉了 R...
SwiGLU 激活函数的全称是 Swish‑Gated Linear Unit,现在已经成为 LLM 中的标配激活函数,实际上,SwiGLU 激活函数是由两部分组成的,分别是 Swish 激活函数和 GLU(Gated Linear Unit)激活函数,集合了两个激活函数的特点。
在 MHA 框架下,结合 KV Cache 的空间换时间,能够极大加速 LLM 的推理,但是对于推理来说,GPU 的显存资源尤其珍贵,这就出现了针对 KV Cache 进一步缩减空间的方案,MQA 和 GQA 就是针对 MHA 的精简方案,通过缩减 K 矩阵和 V 矩阵,达到缩减 KV Cache 的效果。
Batch Norm 的归一化方法不适合在文本模型上做归一化,最重要的原因是文本长度并不固定,同时,基于 Batch Norm 的方法会破坏文本 token 之间的相对顺序,因此才有了 Layer Norm,同时,为了简化,又可以省略掉均值,因此就有了 RMS Norm,针对 Norm 在网络中的位置,Pre Norm 相比较与 Post Norm 来说,使得网络更加容易训练。
computed 是 Vue3 中处理派生状态的核心工具,其缓存机制和懒更新策略使其在处理复杂计算时兼具性能优势和代码可维护性。
响应式系统是 Vue 的基础,正式响应式的设计使得数据的依赖收集、派发更新变得简单,同时,在 Vue3 中,提供了 ref 和 reactive 两种响应式的支持,不同点在于 ref 是为了让基本类型(如 number,string)可以变为响应式,而 reactive 是为了让对象变为响应式,其本质是背后的实现方式的差异,这也就导致在使用上会存在差异。
LoRA 技术结合了残差连接的思想,针对新的训练数据,在固定住原始的矩阵的前提下,通过残差的方式进行微调,同时为了进一步减少参数的量,对微调矩阵进行低秩分解,进一步减少了需要学习的参数的量。
KV Cache 的提出,将 LLM 的推理过程分成了两个阶段,分别是 Prefill 阶段和 Decode 阶段,其中,Prefill 阶段处理的是 LLM 的 Prompt,用于产出首个 Token 以及存储 Prompt 中所有 Token 的 K 向量和 V 向量,此阶段算力要优先于内存的带宽;Decode 阶段则是根据新生成的 Token 以及历史所有 Token 的 K 向量和 ...
LLM 在推理阶段,其实用到的是最终 Embedding 矩阵的最后一行,而影响最后一行的最关键的计算是 Attention 的计算,进而在 Attention 中与其相关的是新增 Token 的 Q 向量,完整 Input 的 K 矩阵以及完整 Input 的 V 矩阵,因此,我们可以将该新增 Token 之前所有 Token 对应的 K,V 向量缓存起来,这便形成了 KV Cache。
SSE(Server-Sent Events)是一种可以主动从服务端推送消息的技术,客户端向服务端发起 HTTP 长连接,服务端返回 stream 响应流。客户端收到 stream 响应流并不会关闭连接而是一直等待服务端发送新的数据流。
WebSocket 是一种在单个 TCP 连接上进行全双工(Full-Duplex)通信的协议。它允许服务器主动向客户端推送数据,打破了传统 Web 通信中“客户端不问、服务器不答”的限制。
Label Stuido 是一个较成熟的标注系统,平时在做 CV 相关的业务时,会使用 Label Stuido 进行训练数据的标注。当然,除了对原始数据的标注之外,还有一部分的需求是对预测后的结果进行“微标注”,也就是对预测的结果做细微调整。然后就是这第二部分的工作,在 Label Studio 中支持得并不是很友好。我从我个人的实践中总结出一套非常好的方式供大家参考,主要针对于图像分割场...
REINFORCE 算法是最经典、最基础的 Policy Gradient(策略梯度)算法,由 Ronald J. Williams (1992) 提出,直接对策略建模,寻找到最优的策略使得总体回报的期望最高。从实验的结果来看,与 DQN 相比,效果及稳定性要低于 DQN。