type
Post
status
Published
date
Oct 11, 2026
slug
llm
summary
tags
技术探索
category
手写
icon
password
我认为大模型提供的是概率性的智能能力,而生产环境需要的是可控、可验证的执行结果。所以 AI 工程的核心不仅是提高模型能力,更是通过 Context Engineering、Haenes Engineering,把模型的不确定性约束在可接受范围内。
我对大模型的理解主要分为四个方面。
第一,底层原理。 目前主流大语言模型主要基于 Transformer 架构,利用 Attention 机制建模 Token 之间的关系,通过预测下一个 Token 生成内容。
第二,训练过程。 通常先通过大规模数据预训练获得通用能力,再通过 SFT 指令微调和 RLHF、DPO 等对齐方法,提高指令遵循能力和回答质量。
第三,工程应用。 我认为大模型的价值不只是对话,而是结合 RAG、Function Calling、Agent 等技术,让模型能够获取外部知识、调用工具、完成复杂任务。
第四,局限性。 大模型本质上仍存在幻觉、上下文限制、推理成本和结果不稳定等问题,因此实际落地不能完全依赖模型本身,还需要通过工具校验、状态管理、评测和执行约束提高可靠性。
在我的 TracePilot 项目中,我也实践了这一思路: 让 LLM 负责故障原因推理,Decision Model 负责执行决策,通过 MCP 获取真实监控数据,并利用 Evidence Memory 管理证据,避免完全依赖 LLM 自由生成排查结果。
分享
