☰
大模型入门指南:小白程序员必看,收藏学习AI新趋势!
2026/9/30 9:23:01 网站建设 项目流程

本文介绍了人工智能的发展历程,重点讲解了Transformer神经网络模型及其在大模型(如GPT)中的应用原理。文章还详细阐述了大模型的部署方式、调用接口规范以及常见应用场景,并对比了传统应用与大模型的各自优势。此外,文章还介绍了四种大模型应用开发的技术架构:纯Prompt模式、Function Calling、RAG和Fine-tuning,并对它们进行了开发成本排序。最后,文章以Spring AI为例,展示了如何配置和使用大模型进行应用开发。

认识AI

1.人工智能发展

AI,人工智能(Artificial Intelligence),使机器能够像人类一样思考、学习和解决问题的技术。

AI发展至今大概可以分为三个阶段:

其中,深度学习领域的自然语言处理(Natural Language Processing, NLP)有一个关键技术叫做Transformer,这是一种由多层感知机组成的神经网络模型,是现如今AI高速发展的最主要原因。

我们所熟知的大模型(Large Language Models, LLM),例如GPT、DeepSeek底层都是采用Transformer神经网络模型。

以GPT模型为例,其三个字母的缩写分别是Generative、Pre-trained、Transformer:

2.大模型原理

其实,最早Transformer是由Google在2017年提出的一种神经网络模型,一开始的作用是把它作为机器翻译的核心:

Transformer中提出的注意力机制使得神经网络在处理信息时可以根据上下内容调整对数据的理解,变得更加智能化。这不仅仅是说人类的文字,包括图片、音频数据都可以交给Transformer来处理。于是,越来越多的模型开始基于Transformer实现了各种神奇的功能。

例如,有的模型可以根据音频生成文本,或者根据文本生成音频:

还有的模型则可以根据文字生成图片,比如Dall-E、MidJourney:

不过,大语言模型(Large Language Models, 以下简称LLM)是对Transformer的另一种用法:推理预测。

LLM在训练Transformer时会尝试输入一些文本、音频、图片等信息,然后让Transformer推理接下来跟着的应该是什么内容。推理的结果会以概率分布的形式出现:

可能大家会有疑问:

仅仅是推测接下来的内容,怎么能让ChatGPT在对话中生成大段的有关联的文字内容呢?

其实LLM采用的就是笨办法,答案就是:持续生成

根据前文推测出接下来的一个词语后,把这个词语加入前文,再次交给大模型处理,推测下一个字,然后不断重复前面的过程,就可以生成大段的内容了。

大模型应用开发

1.模型部署

首先要明确一点:大模型应用开发并不是在浏览器中跟AI聊天。而是通过访问模型对外暴露的API接口,实现与大模型的交互。

token:token可以简单理解成你与大模型交互时发送和响应的文字,通常一个汉字2个token左右,每百万token通常在几毛~几元钱。

大语言模型(LLM)部署配置表:

DeepSeek-R1-Distill-Qwen-7B:Distill 代表蒸馏;Qwen 或 Llama 代表基座模型来源;7B/32B/70B 代表参数量(Billion)。

参数:模型中神经元连接的权重数量,单位是“亿”。

数值类型:模型权重在计算机中存储的格式,决定了精度和体积。

BF8 / BF16:Brain Floating Point 16/8,高精度格式,占用空间大。

INT4:4位整数,极低精度量化。

GGUF:一种专门为 CPU 推理设计的量化格式(通常配合 Ollama 使用)。

模型大小:模型文件在硬盘上占用的存储空间,单位是 GB

术语解释:

H200 / H100 / 910B:数据中心级的高端 AI 加速卡(非常昂贵)。

3090 / 2080Ti:消费级显卡,适合个人或小团队。

8 * Nvidia H200:表示需要 8 张 H200 显卡。

2.调用大模型

大模型接口规范

# Please install OpenAI SDK first: `pip3 install openai` from openai import OpenAI # 1.初始化OpenAI客户端,要指定两个参数:api_key、base_url client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com") # 2.发送http请求到大模型,参数比较多 response = client.chat.completions.create( model="deepseek-chat", # 2.1.选择要访问的模型 messages=[ # 2.2.发送给大模型的消息 {"role": "system", "content": "You are a helpful assistant"}, {"role": "user",content": "Hello"}, ], stream=False # 2.3.是否以流式返回结果 ) print(response.choices[0].message.content)

通常消息的角色有三种:

角色描述示例
system优先于user指令之前的指令,也就是给大模型设定角色和任务背景的系统指令你是一个乐于助人的编程助手,你以小团团的风格来回答用户的问题。
user终端用户输入的指令(类似于你在ChatGPT聊天框输入的内容)写一首关于Java编程的诗
assistant由大模型生成的消息,可能是上一轮对话生成的结果注意,用户可能与模型产生多轮对话,每轮对话模型都会生成不同结果。

会话记忆问题:大模型是没有记忆的,之所以AI对话产品却能够记住每一轮对话信息,是因为Messages数组。

我们只需要每一次发送请求时,都把历史对话中每一轮的User消息、Assistant消息都封装到Messages数组中,一起发送给大模型,这样大模型就会根据这些历史对话信息进一步回答,就像是拥有了记忆一样。

3.大模型应用

大模型应用是基于大模型的推理、分析、生成能力,结合传统编程能力,开发出的各种应用。

能力边界对比:

传统应用AI 大模型
特点基于明确规则的逻辑设计,确定性执行,可预测结果。基于数据驱动的概率推理,擅长处理模糊性和不确定性。
擅长领域1.结构化计算:银行转账系统(精确的数值计算、账户余额增减);Excel公式(按固定规则处理表格数据)。2.确定性任务:排序算法(快速排序、冒泡排序),输入与输出关系完全可预测。3.高性能低延迟场景:操作系统内核调度、数据库索引查询,需要毫秒级响应。 4.规则明确的流程控制:红绿灯信号切换系统(基于时间规则和传感器输入)。1.自然语言处理:ChatGPT生成文章、翻译语言,或客服机器人理解用户意图。2.非结构化数据分析:医学影像识别(X光片中的肿瘤检测),或语音转文本。 3.创造性内容生成:Stable Diffusion生成符合描述的图像,或AI作曲工具创作音乐。 4.复杂模式预测:股票市场趋势预测(基于历史数据关联性,但需注意可靠性限制)。
不擅长领域1.非结构化数据处理:无法直接理解用户自然语言提问(如"帮我写一首关于秋天的诗")。 2.模糊推理与模式识别:判断一张图片是"猫"还是"狗",传统代码需手动编写特征提取规则,效果差。3.动态适应性:若用户需求频繁变化(如电商促销规则每天调整),需不断修改代码。1.精确计算:AI可能错误计算"12345 × 6789"的结果(需依赖计算器类传统程序)。2.确定性逻辑验证:验证身份证号码是否符合规则(AI可能生成看似合理但非法的号码)。3.低资源消耗场景:嵌入式设备(如微波炉控制程序)无法承受大模型的算力需求。4.因果推理:AI可能误判"公鸡打鸣导致日出"的因果关系。

传统应用开发和大模型有着各自擅长的领域:

传统编程:确定性、规则化、高性能,适合数学计算、流程控制等场景。

AI大模型:概率性、非结构化、泛化性,适合语言、图像、创造性任务。

结合方式:

混合系统(Hybrid AI)

用传统程序处理结构化逻辑(如支付校验),AI处理非结构化任务(如用户意图识别)。

示例:智能客服中,AI理解用户问题,传统代码调用数据库返回结果。

增强可解释性

结合规则引擎约束AI输出(如法律文档生成时强制符合条款格式)。

低代码/无代码平台

通过AI自动生成部分代码(如GitHub Copilot),降低传统开发门槛。

我们现在接触的AI对话产品其实都是基于大模型开发的应用,并不是大模型本身

常见的一些大模型对话产品及其模型的关系

大模型对话产品公司地址
GPT-3.5、GPT-4oChatGPTOpenAIhttps://chatgpt.com/
Claude 3.5Claude AIAnthropichttps://claude.ai/chats
DeepSeek-R1DeepSeek深度求索https://www.deepseek.com/
文心大模型3.5文心一言百度https://yiyan.baidu.com/
星火3.5讯飞星火科大讯飞https://xinghuo.xfyun.cn/desk
Qwen-Max通义千问阿里巴巴https://tongyi.aliyun.com/qianwen/
MoonshootKimi月之暗面https://kimi.moonshot.cn/
Yi-Large零一万物零一万物https://platform.lingyiwanwu.com/

AI应用,常见的领域

4.大模型应用开发技术架构

大模型应用开发的技术架构主要有四种

1.纯Prompt模式

仅仅靠一段足够好的提示词

提示词工程(Prompt Engineering):不断雕琢提示词,使大模型能给出最理想的答案

其流程如图:

2.FunctionCalling

大模型虽然可以理解自然语言,更清晰弄懂用户意图,但是确无法直接操作数据库、执行严格的业务规则。这个时候我们就可以整合传统应用于大模型的能力了。

简单来说,可以分为以下步骤:

1

我们可以把传统应用中的部分功能封装成一个个函数(Function)。

2

然后在提示词中描述用户的需求,并且描述清楚每个函数的作用,要求AI理解用户意图,判断什么时候需要调用哪个函数,并且将任务拆解为多个步骤(Agent)。

3

当AI执行到某一步,需要调用某个函数时,会返回要调用的函数名称、函数需要的参数信息。

4

传统应用接收到这些数据以后,就可以调用本地函数。再把函数执行结果封装为提示词,再次发送给AI。

5

以此类推,逐步执行,直到达成最终结果。

注意:并不是所有大模型都支持Function Calling,比如DeepSeek-R1模型就不支持。

3.RAG

RAG(Retrieval-Augmented Generation)叫做检索增强生成。简单来说就是把信息检索技术和大模型结合的方案。

RAG分为两个模块:

检索模块(Retrieval):负责存储和检索拓展的知识库

文本拆分:将文本按照某种规则拆分为很多片段

文本嵌入(Embedding):根据文本片段内容,将文本片段归类存储

文本检索:根据用户提问的问题,找出最相关的文本片段

生成模块(Generation):

组合提示词:将检索到的片段与用户提问组织成提示词,形成更丰富的上下文信息

生成结果:调用生成式模型(例如DeepSeek)根据提示词,生成更准确的回答

由于每次都是从向量库中找出与用户问题相关的数据,而不是整个知识库,所以上下文就不会超过大模型的限制,同时又保证了大模型回答问题是基于知识库中的内容

4.Fine-tuning

Fine-tuning就是模型微调,就是在预训练大模型(比如DeepSeek、Qwen)的基础上,通过企业自己的数据做进一步的训练,使大模型的回答更符合自己企业的业务需求。这个过程通常需要在模型的参数上进行细微的修改,以达到最佳的性能表现。

在进行微调时,通常会保留模型的大部分结构和参数,只对其中的一小部分进行调整。这样做的好处是可以利用预训练模型已经学习到的知识,同时减少了训练时间和计算资源的消耗。微调的过程包括以下几个关键步骤:

选择合适的预训练模型:根据任务的需求,选择一个已经在大量数据上进行过预训练的模型,如Qwen-2.5。

准备特定领域的数据集:收集和准备与任务相关的数据集,这些数据将用于微调模型。

设置超参数:调整学习率、批次大小、训练轮次等超参数,以确保模型能够有效学习新任务的特征。

训练和优化:使用特定任务的数据对模型进行训练,通过前向传播、损失计算、反向传播和权重更新等步骤,不断优化模型的性能。

模型微调虽然更加灵活、强大,但是也存在一些问题:

需要大量的计算资源

调参复杂性高

过拟合风险

5.技术选型

从开发成本由低到高来看,四种方案排序如下:Prompt < Function Calling < RAG < Fine-tuning

Spring AI

  1. 引入依赖
xml <spring-ai.version>1.0.0-M6</spring-ai.version> <dependency> <groupId>org.springframework.ai</groupId> <artifactId>spring-ai-openai-spring-boot-starter</artifactId> </dependency> <dependencyManagement> <dependencies> <dependency> <groupId>org.springframework.ai</groupId> <artifactId>spring-ai-bom</artifactId> <version>${spring-ai.version}</version> <type>pom</type> <scope>import</scope> </dependency> </dependencies> </dependencyManagement>
  1. 配置模型信息

yml

spring: application: name: ai-demo ai: ollama: base-url: http://localhost:11434 # ollama服务地址 chat: model: deepseek-r1:7b # 模型名称,可更改 options: temperature: 0.8 # 模型温度,值越大,输出结果越随机 openai: base-url: https://dashscope.aliyuncs.com/compatible-mode api-key: ${OPENAI_API_KEY} chat: options: model: qwen-max-latest # 可选择的模型列表 https://help.aliyun.com/zh/model-studio/getting-started/models temperature: 0.8 # 模型温度,值越大,输出结果越随机 embedding: options: model: text-embedding-v3 dimensions: 1024
  1. 配置ChatClient

System设定、日志功能、会话记忆功能、工具调用、RAG

java

@Configuration public class CommonConfiguration { @Bean public ChatMemory chatMemory() { return new InMemoryChatMemory(); } // ... 略 @Bean public ChatClient serviceChatClient(OpenAiChatModel model, ChatMemory chatMemory,CourseTools courseTools,VectorStore vectorStore) { return ChatClient .builder(model) .defaultSystem(SystemConstants.GAME_SYSTEM_PROMPT) .defaultAdvisors( new SimpleLoggerAdvisor(), // 添加默认的Advisor,记录日志 new MessageChatMemoryAdvisor(chatMemory) // 会话记忆Advisor new QuestionAnswerAdvisor( vectorStore, // 向量库 SearchRequest.builder() // 向量检索的请求参数 .similarityThreshold(0.5d) // 相似度阈值 .topK(2) // 返回的文档片段数量 .build() ) ) .defaultTools(courseTools) .build(); } }

向量模型

向量是空间中有方向和长度的量,空间可以是二维,也可以是多维。

向量之间的距离有两种计算

通常,两个向量之间欧式距离越近,我们认为两个向量的相似度越高。(余弦距离相反,越大相似度越高)

把文本转为向量,就可以通过向量距离来判断文本的相似度了

智能体,英文叫Agent,它指的是能够自主执行任务的智能系统。

通常一个智能体都有三部分组成:

模型:也就是智能体的大脑,可以是各种具备FunctionCalling能力的通用模型

工具:是模型与外界交互的桥梁,就是我们之前学习过的tool,或者叫function,可以分为三类:

数据类工具(Data):查询数据库、网页、文件等,获取用于执行任务所需的上下文

行动类工具(Action):用于执行具体的操作,比如发送邮件,更新数据库

编排类工具:一种特殊工具,有可能是另一个Agent,实现多Agent互相协作

指令:其实就是提示词,通常是System提示词

MCP(Model Context Protocol),模型上下文协议,由Claude的母公司,Anthropic于2024年底开源发布。

官网的定义:

MCP 是一种开放协议,它标准化了应用程序如何为 LLM 提供上下文。将 MCP 想象成 AI 应用程序的 USB-C 端口。正如 USB-C 提供了一种将设备连接到各种外围设备和配件的标准化方式一样,MCP 也提供了一种将 AI 模型连接到不同数据源和工具的标准化方式。

最后

2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!

金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代。

现在企业疯狂紧缺一类人才:懂业务、懂 AI、能做出可上线项目的大模型开发工程师,岗位缺口大,薪资待遇十分可观。

风口再好,不如手握高薪 offer 实在。行情火热,普通人、程序员该怎样从零入门大模型,抓住这波机会?

今天整理好【2026 最新版】AI 大模型全套免费学习资源,覆盖零基础入门、项目实战、理论知识、大厂面试,从基础一路进阶。所有资料分类归档,没有多余杂料,无套路免费分享给想要入局 AI 赛道的程序员与零基础小白!

👇👇扫码免费领取全部内容👇👇

1、大模型系统化完整学习路线

2、大模型经典书籍&文档

3、AI 大模型最新行业研究报告

4、企业级实战项目 + 完整配套源码

5、大厂大模型面试真题汇总

6、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询