AI生图原理与里程碑论文解读-note

该视频讲解了图像生成模型的重要发展节点,以【扩散】和【自回归】两个路线对生成模型进行总结,最后针对现在LLM中结合图像生成的技术进行了讨论。

本文是自己在看了视频之后对原笔记的搬运与补充。

阅读更多

LoRA笔记

LoRA (Low-Rank Adaptation),一种LLM的微调方法

选择LoRA是因为它通过向变换器层注入可训练的低秩矩阵,主要针对语言模型组件,从而高效适应大型预训练模型。这种方法显著减少了可训练参数的数量,使微调在计算上更轻松,同时保持了强有力的性能。(Kvasir-VQA-x1数据集中介绍)

阅读更多

Transformer精读-AttentionIsAllYouNeed

阅读思路

  • 以往的模型存在的问题/瓶颈——结构的哪些缺陷导致了性能的有限
    • Intro和BG
  • 论文提出的注意力结构解决了什么问题,为什么可以解决
    • 核心:Transformer架构和Self-Attention机制
    • 对应:Model ,Why Self-Attention
阅读更多

笔记本电脑部署BitNet

BitNet是微软在2025年发布的,可以在CPU上运行的本地大模型。

之前在电脑上配置的wsl终于有了用武之地,成功在ubuntu上完成了部署。本文将介绍部署方法并进行效果展示。

阅读更多

自动执行多个终端命令-Python

深度学习实验,后期有许多要交叉验证或者需要多对比的实验,一个一个在终端修改命令参数再执行太麻烦了,可以用subprocess的方法,在某文件中录入所有需要执行的命令,程序自动书序读取执行。

阅读更多
+ + +