Python进阶教程:15.1_OpenAI 库 —— 全方位使用指南
2026/8/24 15:39:45 网站建设 项目流程

一、什么是 OpenAI Python 库?

1.1 一句话定义

openai是 OpenAI 公司官方发布的 Python 客户端库。它把所有与 OpenAI 服务器通信的底层细节(HTTP 请求、身份验证、JSON 解析、错误重试、流式传输)全部封装好了,让你只需要写几行 Python 代码,就能调用 GPT、DALL·E、Whisper 等顶级 AI 模型。

1.2 生活比喻

┌─────────────────────────────────────────────────────────────────────┐ │ │ │ 没有 openai 库(直接写 HTTP 请求): │ │ → 相当于你自己造一辆车去目的地 │ │ → 要自己组装引擎、轮子、方向盘(写 URL、Header、Body) │ │ → 还要自己处理抛锚(错误处理)、加油(Token 管理) │ │ │ │ 有 openai 库: │ │ → 相当于你打了一辆出租车 │ │ → 你只需要说"去哪里"(传参数) │ │ → 司机(库)帮你处理一切驾驶细节 │ │ │ │ 你的 Python 程序 │ │ │ │ │ │ client.chat.completions.create(...) │ │ ▼ │ │ openai 库(帮你组装请求、发送、接收、解析) │ │ │ │ │ │ HTTPS POST → api.openai.com │ │ ▼ │ │ OpenAI 服务器(运行 GPT/DALL-E/Whisper 模型) │ │ │ │ │ │ 返回 JSON 响应 │ │ ▼ │ │ openai 库(帮你解析 JSON → Python 对象) │ │ │ │ │ ▼ │ │ 你拿到结果:response.choices[0].message.content │ │ │ └─────────────────────────────────────────────────────────────────────┘

1.3 openai 库能做什么?(功能全景图)

功能模块对应模型用途
文本生成GPT-4o / GPT-4 / GPT-3.5写文章、写代码、翻译、摘要、对话
图像生成DALL·E 3 / DALL·E 2根据文字描述生成图片
图像编辑DALL·E 2对已有图片进行局部修改
嵌入向量text-embedding-3语义搜索、文本分类、聚类、RAG
语音转文字Whisper音频/视频转录、字幕生成
文字转语音TTS-1 / TTS-1-HD朗读文章、有声书、语音助手
微调基于 GPT-3.5/4用自有数据训练专属模型
助手GPT-4 + 工具构建有记忆、能调工具的复杂 AI 应用
函数调用GPT-4 / GPT-3.5让 AI 调用外部 API、执行代码

1.4 openai 库 vs 直接用 requests

# ============ 方式1:直接用 requests(麻烦) ============ import requests import json url = "https://api.openai.com/v1/chat/completions" headers = { "Authorization": "Bearer sk-你的密钥", "Content-Type": "application/json", } body = { "model": "gpt-3.5-turbo", "messages": [{"role": "user", "content": "你好"}], "temperature": 0.7, } response = requests.post(url, headers=headers, json=body, timeout=60) if response.status_code == 200: data = response.json() reply = data["choices"][0]["message"]["content"] print(reply) elif response.status_code == 429: print("请求太频繁,请稍后重试") elif response.status_code == 401: print("密钥无效") elif response.status_code == 500: print("服务器错误") # ... 还要处理流式、重试、超时等各种情况 # ============ 方式2:用 openai 库(简洁) ============ from openai import OpenAI client = OpenAI() response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "你好"}], ) print(response.choices[0].message.content) # 对比: # - 不需要手动拼 URL # - 不需要手动设置 Header # - 不需要手动解析 JSON # - 不需要手动处理各种 HTTP 状态码 # - 自带类型提示(IDE 自动补全) # - 自带重试机制

二、安装与环境配置

2.1 安装

# 基础安装 pip install openai # 验证安装 python -c "import openai; print(openai.__version__)" # 输出:1.35.x(确保是 1.x 版本!) # ⚠️ 注意:openai 库在 2023 年底发布了 v1.0 大版本更新 # 旧版语法(openai.ChatCompletion.create)已废弃 # 新版语法(client.chat.completions.create)是当前标准 # 如果你跟着旧教程学,代码会报错!

2.2 获取 API Key

步骤: 1. 访问 https://platform.openai.com 2. 注册/登录账号 3. 点击左侧菜单 "API Keys" 4. 点击 "Create new secret key" 5. 复制生成的密钥(格式:sk-proj-xxxxxxxx) 6. ⚠️ 只显示一次!务必保存好!

2.3 配置 API Key(三种方式)

# ============ 方式1:环境变量(最推荐!) ============ # 在终端设置(Linux/macOS): # export OPENAI_API_KEY="sk-proj-你的密钥" # 在终端设置(Windows CMD): # set OPENAI_API_KEY=sk-proj-你的密钥 # 在终端设置(Windows PowerShell): # $env:OPENAI_API_KEY="sk-proj-你的密钥" # Python 代码中直接创建 client(自动读取环境变量) from openai import OpenAI client = OpenAI() # 自动从 OPENAI_API_KEY 环境变量读取 # ============ 方式2:直接传入(仅测试用!) ============ from openai import OpenAI client = OpenAI(api_key="sk-proj-你的密钥") # ⚠️ 绝对不要把密钥提交到 Git! # ============ 方式3:用 .env 文件(项目推荐) ============ # 1. 安装:pip install python-dotenv # 2. 在项目根目录创建 .env 文件: # OPENAI_API_KEY=sk-proj-你的密钥 # 3. 在 .gitignore 中添加 .env(防止提交到 Git) # 4. Python 代码: from dotenv import load_dotenv import os load_dotenv() # 自动加载 .env 文件 from openai import OpenAI client = OpenAI(api_key=os.getenv("OPENAI_API_KEY"))

2.4 Client 对象详解

from openai import OpenAI # Client 是所有 API 调用的入口 client = OpenAI( api_key="sk-proj-xxx", # API 密钥 base_url="https://api.openai.com/v1", # API 地址(默认值) timeout=60.0, # 请求超时(秒) max_retries=2, # 失败自动重试次数 ) # 如果你用的是代理/中转服务,修改 base_url: # client = OpenAI( # api_key="sk-xxx", # base_url="https://your-proxy.com/v1" # ) # Client 对象包含所有功能模块: # client.chat → 对话补全 # client.images → 图像生成 # client.embeddings → 文本嵌入 # client.audio → 语音处理 # client.files → 文件管理 # client.fine_tuning → 微调 # client.beta → 助手(Assistants) # client.models → 模型列表

三、核心概念详解

3.1 Token(词元)—— 计费单位

# Token 是 AI 处理文本的最小单位 # 英文:大约 1 个单词 ≈ 1~1.5 个 token # 中文:大约 1 个汉字 ≈ 1.5~2 个 token # 标点、空格也算 token # 例子: "Hello world" → 约 2 个 token "你好,世界" → 约 5 个 token "Python是一种编程语言" → 约 10 个 token # Token 影响: # 1. 费用:按 input_tokens + output_tokens 计费 # 2. 上下文窗口:模型一次能处理的最大 token 数 # - GPT-3.5-turbo:约 16K tokens # - GPT-4:约 128K tokens # - GPT-4o:约 128K tokens # 查看一次请求消耗了多少 token: response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "你好"}] ) print(response.usage) # CompletionUsage(prompt_tokens=9, completion_tokens=12, total_tokens=21) print(f"输入:{response.usage.prompt_tokens} tokens") print(f"输出:{response.usage.completion_tokens} tokens") print(f"总计:{response.usage.total_tokens} tokens")

3.2 Model(模型)—— AI 的大脑

# 查看可用模型列表 from openai import OpenAI client = OpenAI() models = client.models.list() for model in models.data: print(model.id) # 常用模型对比: # ┌──────────────────┬──────────┬──────────┬──────────────────┐ # │ 模型名称 │ 速度 │ 智能 │ 适用场景 │ # ├──────────────────┼──────────┼──────────┼──────────────────┤ # │ gpt-4o │ 快 │ 最强 │ 复杂推理、多模态 │ # │ gpt-4o-mini │ 最快 │ 较强 │ 日常对话、轻量任务│ # │ gpt-4-turbo │ 中 │ 很强 │ 长文本、代码 │ # │ gpt-3.5-turbo │ 快 │ 一般 │ 简单任务、低成本 │ # │ dall-e-3 │ 慢 │ - │ 图像生成 │ # │ whisper-1 │ 中 │ - │ 语音转文字 │ # │ tts-1 │ 快 │ - │ 文字转语音 │ # └──────────────────┴──────────┴──────────┴──────────────────┘

3.3 Temperature(温度)—— 控制创造力

# temperature 控制输出的随机性/创造性 # 范围:0.0 ~ 2.0 # temperature = 0: # → 最确定性的输出,每次几乎一样 # → 适合:事实问答、代码生成、数据提取 # temperature = 0.7(默认): # → 平衡创造力和准确性 # → 适合:日常对话、写作 # temperature = 1.0~2.0: # → 最随机、最有创意 # → 适合:头脑风暴、诗歌、故事创作 # 示例对比: from openai import OpenAI client = OpenAI() prompt = "给一只猫取个名字" # 低温度 → 保守、常见 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}], temperature=0.1 ) print(f"低温(0.1):{response.choices[0].message.content}") # 可能输出:"小花"、"咪咪"(很常见) # 高温度 → 创意、独特 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}], temperature=1.5 ) print(f"高温(1.5):{response.choices[0].message.content}") # 可能输出:"量子毛球"、"薛定谔的喵酱"(很独特)

3.4 max_tokens —— 控制输出长度

# max_tokens 限制模型最多生成多少个 token # 注意:这不是"必须生成这么多",而是"最多生成这么多" response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "写一首关于春天的诗"}], max_tokens=50 # 最多输出约25个汉字 ) # 模型可能在 50 token 内就写完了,也可能被截断

四、文本生成(Chat Completions)⭐ 最核心功能

4.1 消息结构详解

# messages 是一个列表,每个元素是一个字典 # 必须包含 "role" 和 "content" 两个键 messages = [ # system:设定 AI 的身份、规则、限制(可选但强烈推荐) { "role": "system", "content": "你是一位资深Python程序员,回答简洁明了,代码必须有注释。" }, # user:用户的输入 { "role": "user", "content": "如何读取CSV文件?" }, # assistant:AI 之前的回复(多轮对话时需要) { "role": "assistant", "content": "使用 pandas 库:\nimport pandas as pd\ndf = pd.read_csv('data.csv')" }, # user:用户的新问题 { "role": "user", "content": "如果文件是GBK编码怎么办?" }, ]

4.2 三种角色的作用

# ============ system(系统提示) ============ # 作用:设定 AI 的"人设"和行为规则 # 特点:优先级最高,AI 会优先遵守 system 的指令 # 比喻:给演员的"角色说明书" {"role": "system", "content": "你是一个严厉但公正的数学老师"} {"role": "system", "content": "你只能用中文回答,每次回答不超过100字"} {"role": "system", "content": "你是JSON格式化助手,只输出JSON,不输出其他任何文字"} # ============ user(用户消息) ============ # 作用:用户的提问、指令、输入 # 比喻:观众对演员说的话 {"role": "user", "content": "帮我写一个排序算法"} {"role": "user", "content": "把这段话翻译成英文:今天天气真好"} # ============ assistant(AI回复) ============ # 作用:记录 AI 之前说过的话(提供上下文) # 比喻:演员之前说过的台词(让演员记住自己说了什么) {"role": "assistant", "content": "好的,这是冒泡排序的实现..."}

4.3 最简单的完整示例

from openai import OpenAI # 第1步:创建客户端 client = OpenAI() # 第2步:调用 API response = client.chat.completions.create( model="gpt-3.5-turbo", # 使用哪个模型 messages=[ # 对话内容 {"role": "user", "content": "1+1等于几?"} ], ) # 第3步:提取回复 # response 的结构: # response # ├── .id → 请求唯一ID # ├── .model → 实际使用的模型 # ├── .choices → 回复列表(通常只有1个) # │ └── [0] # │ ├── .message → 消息对象 # │ │ ├── .role → "assistant" # │ │ └── .content → 回复文本 ⭐ 这是你要的! # │ ├── .finish_reason → 结束原因(stop/length) # │ └── .index → 索引 # ├── .usage → token 用量 # │ ├── .prompt_tokens → 输入 token 数 # │ ├── .completion_tokens → 输出 token 数 # │ └── .total_tokens → 总 token 数 # └── .created → 时间戳 reply = response.choices[0].message.content print(reply) # "1+1等于2。" # 查看 token 消耗 print(f"消耗 {response.usage.total_tokens} 个 token")

4.4 带 system 提示的示例

from openai import OpenAI client = OpenAI() # 场景:让 AI 扮演一个翻译官 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ { "role": "system", "content": """你是一个专业的中英翻译官。 规则: 1. 如果用户输入中文,翻译成英文 2. 如果用户输入英文,翻译成中文 3. 只输出翻译结果,不要解释 4. 保持原文的语气和风格""" }, { "role": "user", "content": "今天的会议推迟到下午三点" } ], temperature=0.3, # 翻译需要准确,温度低一些 ) print(response.choices[0].message.content) # "Today's meeting has been postponed to 3 PM."

4.5 多轮对话(带记忆)

from openai import OpenAI client = OpenAI() # 关键:把整个对话历史都传给 API # AI 本身没有记忆!每次调用都是独立的! # 所谓的"记忆"就是你把之前的对话都传进去 # 第1轮对话 messages = [ {"role": "system", "content": "你是一个友好的助手,回答简洁。"}, {"role": "user", "content": "我叫小明,我今年25岁。"} ] response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages ) ai_reply_1 = response.choices[0].message.content print(f"AI:{ai_reply_1}") # "你好小明!很高兴认识你。" # 把 AI 的回复加入历史 messages.append({"role": "assistant", "content": ai_reply_1}) # 第2轮对话 messages.append({"role": "user", "content": "我叫什么名字?"}) response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages # 传完整历史! ) ai_reply_2 = response.choices[0].message.content print(f"AI:{ai_reply_2}") # "你叫小明。"(因为历史里有这个信息) # 把 AI 的回复加入历史 messages.append({"role": "assistant", "content": ai_reply_2}) # 第3轮对话 messages.append({"role": "user", "content": "我几岁?"}) response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages ) print(f"AI:{response.choices[0].message.content}") # "你今年25岁。"

4.6 多轮对话的完整交互版本

from openai import OpenAI client = OpenAI() def chat_loop(): """交互式聊天机器人""" messages = [ {"role": "system", "content": "你是一个知识渊博且幽默的助手。"} ] print("🤖 AI 助手已就绪(输入 'quit' 退出)") print("-" * 40) while True: # 获取用户输入 user_input = input("\n你:").strip() if user_input.lower() in ("quit", "exit", "q"): print("👋 再见!") break if not user_input: continue # 添加用户消息 messages.append({"role": "user", "content": user_input}) # 调用 API response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages, temperature=0.7, ) # 提取回复 ai_reply = response.choices[0].message.content print(f"\nAI:{ai_reply}") # 添加 AI 回复到历史 messages.append({"role": "assistant", "content": ai_reply}) # ⚠️ 防止历史太长超出上下文窗口 # 简单策略:只保留最近 20 条消息 + system if len(messages) > 21: messages = [messages[0]] + messages[-20:] chat_loop()

4.7 流式输出(打字机效果)

from openai import OpenAI client = OpenAI() # 普通调用:等 AI 全部生成完才返回(可能等很久) # 流式调用:AI 每生成几个字就立刻推送给你 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ {"role": "user", "content": "写一首关于秋天的短诗"} ], stream=True, # ⭐ 开启流式 ) # response 现在是一个生成器(generator),逐块返回 full_reply = "" print("AI:", end="") for chunk in response: # 每个 chunk 包含一小段文本 # chunk.choices[0].delta.content 是当前这一小段 # 第一个 chunk 的 delta 可能包含 role # 最后一个 chunk 的 delta.content 可能是 None if chunk.choices[0].delta.content is not None: text = chunk.choices[0].delta.content print(text, end="", flush=True) # 实时打印,不换行 full_reply += text print() # 最后换行 print(f"\n完整回复:{full_reply}")

4.8 流式输出的详细解释

# 流式返回的 chunk 结构: # chunk # ├── .id # ├── .choices # │ └── [0] # │ ├── .delta → 增量内容(不是完整内容!) # │ │ ├── .role → 只在第一个 chunk 出现 # │ │ └── .content → 当前这一小段文字(可能是None) # │ ├── .finish_reason → 只在最后一个 chunk 出现("stop") # │ └── .index # └── .created # 为什么需要 flush=True? # Python 的 print 默认有缓冲区 # 如果不 flush,文字会攒够一批才显示 # flush=True 强制立即输出到屏幕

4.9 n 参数 —— 一次生成多个回复

from openai import OpenAI client = OpenAI() # n=3:让模型生成3个不同的回复供你选择 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "给咖啡店取个名字"}], n=3, # 生成3个候选 temperature=1.0, # 温度高一些,让3个结果差异更大 ) # 遍历所有候选回复 for i, choice in enumerate(response.choices, 1): print(f"方案{i}:{choice.message.content}") # 输出类似: # 方案1:晨曦咖啡 # 方案2:豆语时光 # 方案3:半日闲咖啡馆

4.10 stop 参数 —— 自定义停止词

from openai import OpenAI client = OpenAI() # 当模型生成的文本中包含 stop 中的内容时,立即停止 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ {"role": "user", "content": "列出5种水果,每行一个"} ], stop=["\n4"], # 遇到第4个就停(只要前3个) ) print(response.choices[0].message.content) # 只会输出前3种水果 # 常见用法: # stop=["\n"] → 只生成一行 # stop=["。"] → 遇到句号就停 # stop=["END"] → 遇到自定义标记就停

4.11 完整参数列表

response = client.chat.completions.create( # ===== 必填参数 ===== model="gpt-3.5-turbo", # 模型名称 messages=[...], # 消息列表 # ===== 可选参数 ===== temperature=0.7, # 随机性(0~2) top_p=1.0, # 核采样(与temperature二选一调) n=1, # 生成几个候选回复 stream=False, # 是否流式输出 stop=None, # 停止词列表 max_tokens=None, # 最大输出token数 presence_penalty=0.0, # 主题惩罚(-2~2,越大越不愿重复话题) frequency_penalty=0.0, # 频率惩罚(-2~2,越大越不愿重复用词) logit_bias=None, # 调整特定token的概率 user=None, # 用户标识(用于OpenAI监控滥用) response_format=None, # 响应格式(如强制JSON) seed=None, # 随机种子(尽量可复现) tools=None, # 可调用的工具/函数 tool_choice=None, # 工具选择策略 )

4.12 强制 JSON 输出

from openai import OpenAI import json client = OpenAI() # 让 AI 严格输出 JSON 格式 response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ { "role": "system", "content": "你是一个数据提取助手。从用户输入中提取信息,以JSON格式输出。" }, { "role": "user", "content": "张三,男,28岁,住在北京海淀区,电话13800138000" } ], response_format={"type": "json_object"}, # ⭐ 强制JSON输出 ) result = response.choices[0].message.content data = json.loads(result) # 安全解析为字典 print(data) # {"name": "张三", "gender": "男", "age": 28, # "address": "北京海淀区", "phone": "13800138000"}

五、图像生成(DALL·E)

5.1 文生图(text-to-image)

from openai import OpenAI client = OpenAI() # ============ DALL·E 3(推荐) ============ response = client.images.generate( model="dall-e-3", prompt="一只橘猫坐在窗台上,窗外是下雨的城市夜景,霓虹灯倒映在雨滴中,吉卜力动画风格", size="1024x1024", # 尺寸:1024x1024, 1792x1024, 1024x1792 quality="hd", # 质量:standard(快)或 hd(更精细) style="vivid", # 风格:vivid(生动)或 natural(自然) n=1, # DALL·E 3 只能为 1 ) # 获取结果 image_url = response.data[0].url # 图片URL(有效期1小时) print(f"图片地址:{image_url}") # ⚠️ DALL·E 3 会自动改写你的 prompt(让它更详细) # 查看实际使用的 prompt: print(f"实际prompt:{response.data[0].revised_prompt}")

5.2 下载生成的图片

import requests from openai import OpenAI client = OpenAI() response = client.images.generate( model="dall-e-3", prompt="水墨画风格的山水,远山如黛,近水含烟", size="1792x1024", quality="hd", ) image_url = response.data[0].url # 方法1:用 requests 下载 img_response = requests.get(image_url) with open("my_art.png", "wb") as f: f.write(img_response.content) print("图片已保存为 my_art.png") # 方法2:直接请求 base64(不依赖URL有效期) response = client.images.generate( model="dall-e-3", prompt="一只熊猫在吃竹子", response_format="b64_json", # 返回 base64 编码 ) import base64 img_data = base64.b64decode(response.data[0].b64_json) with open("panda.png", "wb") as f: f.write(img_data)

5.3 图像编辑(DALL·E 2)

from openai import OpenAI client = OpenAI() # 对已有图片进行局部编辑 # 需要:原图 + 遮罩图(mask) # 遮罩图中透明区域(alpha=0)的部分会被 AI 重新生成 response = client.images.edit( model="dall-e-2", image=open("photo.png", "rb"), # 原图(必须是 PNG,<=4MB) mask=open("mask.png", "rb"), # 遮罩(同尺寸 PNG) prompt="把天空变成紫色的晚霞", # 描述要修改的内容 n=1, size="1024x1024", ) edited_url = response.data[0].url print(f"编辑后的图片:{edited_url}")

5.4 图像变体(DALL·E 2)

# 生成一张图片的多个变体 response = client.images.create_variation( model="dall-e-2", image=open("original.png", "rb"), n=4, # 生成4个变体 size="1024x1024", ) for i, img in enumerate(response.data, 1): print(f"变体{i}:{img.url}")

5.5 写好 prompt 的技巧

# ❌ 差的 prompt: "一只猫" # ✅ 好的 prompt(包含:主体 + 动作 + 环境 + 风格 + 光线 + 构图): """ 主体:一只银白色的英短猫 动作:慵懒地趴在沙发上 环境:温暖的客厅,背景有书架和绿植 风格:摄影写实风格,浅景深 光线:午后的暖黄色阳光从窗户照进来 构图:特写,猫占画面2/3 """ # 组合成完整 prompt: prompt = ( "一只银白色的英短猫慵懒地趴在米色沙发上," "背景是温馨的客厅,有木质书架和绿色植物," "午后暖黄色阳光从左侧窗户照入," "摄影写实风格,浅景深,特写构图,8K画质" )

六、嵌入(Embeddings)

6.1 什么是嵌入?通俗解释

# 嵌入 = 把文字变成一串数字(向量) # 语义相近的文字 → 向量距离近 # 语义不同的文字 → 向量距离远 # 比喻: # "国王" → [0.8, 0.2, 0.9, ...] ┐ # "女王" → [0.79, 0.21, 0.88, ...] ┘ 距离很近!(语义相似) # # "国王" → [0.8, 0.2, 0.9, ...] ┐ # "香蕉" → [0.1, 0.9, 0.05, ...] ┘ 距离很远!(语义不同) # 用途: # 1. 语义搜索:找"意思相近"的文档 # 2. 文本分类:自动归类文章 # 3. 聚类:把相似文本分组 # 4. RAG(检索增强生成):给 AI 提供相关知识 # 5. 推荐系统:找相似内容

6.2 生成嵌入向量

from openai import OpenAI client = OpenAI() # ============ 单条文本 ============ response = client.embeddings.create( model="text-embedding-3-small", # 或 text-embedding-3-large input="机器学习是人工智能的一个分支" ) embedding = response.data[0].embedding print(f"向量维度:{len(embedding)}") # 1536(small)或 3072(large) print(f"前5个值:{embedding[:5]}") # [0.0023, -0.0091, 0.0156, ...] # ============ 批量文本(更高效) ============ texts = [ "Python是一种编程语言", "Java也是一种编程语言", "今天天气真好", "我喜欢写代码", "明天会下雨吗", ] response = client.embeddings.create( model="text-embedding-3-small", input=texts # 传入列表 ) # 获取所有向量 embeddings = [item.embedding for item in response.data] print(f"生成了 {len(embeddings)} 个向量") print(f"每个向量维度:{len(embeddings[0])}")

6.3 计算文本相似度

from openai import OpenAI import numpy as np client = OpenAI() def get_embedding(text): """获取文本的嵌入向量""" response = client.embeddings.create( model="text-embedding-3-small", input=text ) return np.array(response.data[0].embedding) def cosine_similarity(v1, v2): """计算余弦相似度(0~1,越大越相似)""" return np.dot(v1, v2) / (np.linalg.norm(v1) * np.linalg.norm(v2)) # 计算三句话的相似度 text_a = "我喜欢编程" text_b = "写代码是我的爱好" text_c = "今天中午吃什么" emb_a = get_embedding(text_a) emb_b = get_embedding(text_b) emb_c = get_embedding(text_c) sim_ab = cosine_similarity(emb_a, emb_b) sim_ac = cosine_similarity(emb_a, emb_c) print(f"'{text_a}' vs '{text_b}':相似度 = {sim_ab:.4f}") # ≈ 0.92(很相似) print(f"'{text_a}' vs '{text_c}':相似度 = {sim_ac:.4f}") # ≈ 0.15(不相似)

6.4 语义搜索实战

from openai import OpenAI import numpy as np client = OpenAI() # 知识库 documents = [ "Python是一种解释型编程语言,适合数据科学和AI开发", "Java是一种面向对象的编程语言,广泛用于企业级开发", "JavaScript是网页开发的核心语言,运行在浏览器中", "C++是一种高性能编程语言,常用于游戏开发和操作系统", "今天股市大涨,上证指数突破3500点", "Python的pandas库是数据分析的利器", ] # 1. 预先把所有文档转成向量 print("正在构建知识库向量...") doc_embeddings = [] for doc in documents: resp = client.embeddings.create( model="text-embedding-3-small", input=doc ) doc_embeddings.append(np.array(resp.data[0].embedding)) # 2. 用户提问 query = "哪个语言适合做数据分析?" query_resp = client.embeddings.create( model="text-embedding-3-small", input=query ) query_embedding = np.array(query_resp.data[0].embedding) # 3. 计算相似度并排序 similarities = [] for i, doc_emb in enumerate(doc_embeddings): sim = np.dot(query_embedding, doc_emb) / ( np.linalg.norm(query_embedding) * np.linalg.norm(doc_emb) ) similarities.append((sim, i)) similarities.sort(reverse=True) # 按相似度降序 # 4. 输出最相关的结果 print(f"\n查询:'{query}'") print("最相关的文档:") for sim, idx in similarities[:3]: print(f" [{sim:.4f}] {documents[idx]}") # 输出: # [0.8921] Python是一种解释型编程语言,适合数据科学和AI开发 # [0.8456] Python的pandas库是数据分析的利器 # [0.6234] Java是一种面向对象的编程语言,广泛用于企业级开发

七、语音转文字(Whisper)

7.1 基本转录

from openai import OpenAI client = OpenAI() # 打开音频文件(支持:mp3, mp4, mpeg, mpga, m4a, wav, webm) # 文件大小限制:25MB audio_file = open("meeting_recording.mp3", "rb") # 调用转录接口 transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, # language="zh", # 指定语言(可选,自动检测也行) # response_format="text", # 输出格式:"json"/"text"/"srt"/"vtt"/"verbose_json" ) print(transcript.text) # "大家好,今天的会议主要讨论三个议题..."

7.2 带时间戳的转录

from openai import OpenAI client = OpenAI() audio_file = open("podcast.mp3", "rb") # 使用 verbose_json 格式获取时间戳 transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, response_format="verbose_json", timestamp_granularities=["segment"], # 段落级时间戳 ) print(f"语言:{transcript.language}") print(f"总时长:{transcript.duration}秒") print() for segment in transcript.segments: start = segment["start"] end = segment["end"] text = segment["text"] print(f"[{start:.1f}s - {end:.1f}s] {text}") # 输出: # [0.0s - 3.2s] 大家好,欢迎收听本期节目 # [3.2s - 7.8s] 今天我们要聊的是人工智能的未来 # [7.8s - 12.1s] 首先让我们回顾一下AI的发展历程

7.3 生成字幕文件

from openai import OpenAI client = OpenAI() audio_file = open("video_audio.mp3", "rb") # 生成 SRT 字幕格式 transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, response_format="srt", ) # 保存为字幕文件 with open("subtitle.srt", "w", encoding="utf-8") as f: f.write(transcript.text) print("字幕已保存为 subtitle.srt") # SRT 格式示例: # 1 # 00:00:00,000 --> 00:00:03,200 # 大家好,欢迎收听本期节目 # # 2 # 00:00:03,200 --> 00:00:07,800 # 今天我们要聊的是人工智能的未来

7.4 翻译转录

# 把非英语音频直接翻译成英语文字 audio_file = open("chinese_speech.mp3", "rb") translation = client.audio.translations.create( model="whisper-1", file=audio_file, ) print(translation.text) # 输出英文翻译

(由于内容较多,本期分成15.1和15.2两部分,请继续查看15.2)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询