Zhang Haoyi
Hi, I'm Zhang Haoyi - HUST CS undergrad (2024). I'm an enthusiastic learner, developer and blogger. Welcome to my personal space where I share my thoughts, notes, projects, and experiences.
统计
74文章
8分类
223标签
目录
-
文章
-
ai_agent
- Agent Architecture —— LLM & Planning & Tool & Memory
- Agent Communication Protocols —— MCP & A2A
- Agent Engineering —— Prompt & Context & Harness & Loop
- Agent Paradigms —— ReAct & Plan-and-Solve & Reflection
- Function Calling —— 工具调用
- Memory Mechanisms Evolution: From Storage to Experience —— 智能体记忆机制的演化综述
- Memory System —— Agent记忆系统
- Multi-Agent System—— 多智能体系统
- Recursive Self-Improvement(RSI)—— 递归自我改进综述
- Retrieval-Augmented Generation —— 检索增强生成
- Self-Evolving Agents (What、When、How、Where) —— 自进化智能体综述
-
ai_alignment
- Comparison of RL Algorithm —— PPO、GRPO、DPO、DAPO、GSPO技术详解与对比
- DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization) -- 解耦裁剪与动态采样策略优化
- DPO (Direct Preference Optimization) -- 直接偏好优化
- GRPO (Group Relative Policy Optimization) -- 群体相对策略优化
- GSPO (Group Sequence Policy Optimization) -- 群组序列策略优化
- PEFT (Parameter-Efficient Fine-Tuning) —— 参数高效微调
- PPO(Proximal Policy Optimization) -- 近端策略优化
- Reinforcement Learning -- 策略梯度、优势函数、重要性采样与KL散度惩罚
- RLHF (Reinforcement Learning from Human Feedback) —— 基于人类反馈的强化学习
- RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
- SFT (Supervised Fine-Tuning)—— 监督微调
-
ai_multimodal
- Contrastive Language-Image Pre-training —— CLIP对比学习
- Denoising Diffusion Probabilistic Models —— DDPM扩散模型
- Multimodal Large Language Model —— MLLM多模态大语言模型
- Multimodal RAG —— 多模态RAG
- Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
- Vision Transformer —— ViT视觉Transformer
- Vision-Language Model —— VLM视觉语言模型
- Vision-Language-Action —— VLA具身智能
-
cs336
-
deep_learning
- Activation & Initialization —— 激活函数与权重初始化
- Autograd & Computational Graph —— 自动微分与计算图
- CNN —— 卷积神经网络
- Gradient Descent Optimizer —— 梯度下降优化器
- LSTM & GRU —— 门控循环神经网络
- MLP & Back Propagation —— 多层感知机与反向传播
- Probability & Information —— 概率论与信息论基础
- Residual Network —— ResNet残差网络
- RNN & BPTT —— 循环神经网络与随时间反向传播
- Tensor Operations —— 向量、矩阵与张量运算
-
machine_learning
- Adaptive Boosting (AdaBoost) —— 自适应提升
- Bagging & Random Forest —— 随机森林
- Decision Tree —— 决策树
- Expectation-Maximization Algorithm —— EM算法
- Gradient Boosting Machine (GBM) —— 梯度提升机与加法模型
- Hidden Markov Model (HMM) —— 隐马尔可夫模型
- K-Means Clustering —— 聚类算法
- K-Nearest Neighbor (KNN) —— K-近邻
- Kernel Trick —— 核技巧与常用核函数
- Linear Regression —— 线性回归
- Logistic Regression —— 逻辑回归与Softmax多分类
- Naive Bayes —— 朴素贝叶斯
- Principal Component Analysis (PCA) —— 主成分分析
- Support Vector Machine (SVM) —— 支持向量机
- XGBoost & LightGBM —— 梯度提升框架
-
-
相册
-
IB_Course
-
Calculus
-
Data Strctures
-
Discrete Mathematics
-
Physics Experiment
-
Physics(1)
-
Probability and Statistic
-
-
IIA_Course
-
Algorithm
-
Digital Circuits
-
Physics(2)
-
-
IIB_Course
-
Computer Organization
-
Database
-
MaoZedong
-
Signal and Linear Systems
-
-
Scenery
-
-
项目展示
-
CME295
-
CS336
-
分类
标签
Recursive Self-Improvement(RSI)—— 递归自我改进综述
系统解读递归自我改进(RSI)综述,围绕进化对象(参数、上下文、记忆、Skill、Harness代码)、进化结构(链、树、图)、更新来源(自身、教师、联合)、更新时机(离线、在线、混合)等维度建立 RSI 分类体系,并深入分析评估瓶颈、验证层级、L1-L5 自主性谱系、工业实践与开放挑战。
8856 字
|
44 分钟
Self-Evolving Agents (What、When、How、Where) —— 自进化智能体综述
系统解读自进化智能体综述,围绕 What、When、How、Where 四大核心问题,系统梳理自进化智能体的进化对象(模型、上下文、工具、架构)、进化时机(测试时内/测试时间)、进化方法(奖励/模仿/种群)与落地领域,并涵盖五维评估体系、开放挑战与未来方向。
9962 字
|
50 分钟
Memory Mechanisms Evolution: From Storage to Experience —— 智能体记忆机制的演化综述
系统梳理 LLM Agent 记忆机制从 Storage、Reflection 到 Experience 的演化框架。解析长期一致性、动态环境与持续学习三大驱动,剖析主动探索与跨轨迹抽象两大变革机制,并展望主动记忆感知、工作记忆、经验基准、分布式共享记忆与多模态记忆等未来方向。
5071 字
|
25 分钟
Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
系统讲解视频理解与生成、音频处理的核心技术:从视频的时空维度出发,剖析3D卷积与时空注意力如何建模动态信息;深入解读VideoMAE的视频Tube掩码策略与90-95%超高掩码比例的时空自监督预训练;剖析Sora视频扩散模型的核心组件及其灵活处理任意分辨率/时长视频的能力;梳理音频处理基础与Whisper的编码器-解码器架构,并介绍VALL-E将语音合成建模为条件语言模型的新范式。
4030 字
|
20 分钟
Vision-Language-Action —— VLA具身智能
系统讲解具身智能中视觉-语言-动作模型(VLA)的核心技术:从RT-2的“动作即文本”范式出发,剖析动作Token化与Co-Fine-Tuning联合微调策略的数学原理;深入解读动作分块如何通过一次性预测未来K步动作解决时序不一致性问题;推导扩散策略中条件去噪扩散过程的噪声预测损失及其与动作分块的天作之合;并通过三维对比揭示各自优势与融合趋势。
5734 字
|
29 分钟
Multimodal RAG —— 多模态RAG
系统讲解多模态文档检索的前沿技术ColPali:从传统OCR流水线的脆弱性出发,剖析ColPali如何通过PaliGemma视觉语言模型直接编码文档页面图像,跳过OCR与布局解析环节;深入解读延迟交互机制中MaxSim评分函数的数学原理及其相比单向量余弦相似度的精度优势;分析多粒度索引策略与跨模态查询重写技术。
4750 字
|
24 分钟
Denoising Diffusion Probabilistic Models —— DDPM扩散模型
系统讲解扩散模型(DDPM)的数学原理与条件生成技术:从马尔可夫链的前向扩散与反向去噪出发,推导ELBO如何简化为噪声预测MSE损失;深入剖析潜空间扩散如何通过VAE压缩实现约50倍计算量降低;追溯去噪网络从U-Net到DiT的架构演进及其在Sora中的应用;解析CFG的线性外推公式及引导强度的权衡.
4161 字
|
21 分钟
Multimodal Large Language Model —— MLLM多模态大语言模型
系统讲解多模态大语言模型(MLLM)的核心架构设计与训练范式演进:从模态连接器的三种经典方案出发,剖析视觉编码器的解冻策略与三阶段训练范式;深入探讨细粒度数据标注、幻觉缓解与评估基准;最后追溯从“拼接式”架构到原生统一架构的演进路径,揭示从“表征对齐”到“表征统一”的范式转变。
3880 字
|
19 分钟
Vision-Language Model —— VLM视觉语言模型
系统讲解视觉语言模型(VLM)的通用架构,深入对比三种主流连接器方案的设计权衡;详细剖析两阶段训练流程及其目标差异;梳理从双塔架构到原生多模态的三代演进路径;最后深度解析Qwen3-VL的三项核心创新——Interleaved-MRoPE、DeepStack集成、文本化时间戳对齐,及其2B/4B/8B/32B稠密和MoE架构的模型系列与256K超长上下文特性。
3637 字
|
18 分钟
Vision Transformer —— ViT视觉Transformer
系统讲解视觉Transformer(ViT)的核心机制与技术演进:从Patch Embedding与位置嵌入的基础原理出发,对比ViT与CNN在归纳偏置上的根本差异及DeiT通过知识蒸馏弥补数据效率的尝试;深入剖析Swin Transformer的窗口注意力与层级化特征表示、可变形注意力的动态聚焦机制;系统梳理高分辨率适配的三条技术路线——AnyRes/LLaVA-UHD的切图融合策略、NaViT/ViTAR的原生动态分辨率方案、以及RoPE/插值/LookHere等位置编码外推方法。
4051 字
|
20 分钟