将 Embedding 模型加载到 Elasticsearch 中
本工作簿使用一个由 Elastic 博客标题组成的简单数据集在 Elasticsearch 中实现 NLP 文本搜索。你将索引博客文档并使用 ingest pipeline 生成文本 embedding。随后通过使用 NLP 模型你可以使用自然语言对这些博客文档进行查询。更多阅读Elasticsearch如何部署文本嵌入模型并将其用于语义搜索前提条件在开始之前请创建一个 Elastic Cloud deployment并启用 autoscale确保至少有一个具有足够4GB内存的机器学习ML节点。同时确保 Elasticsearch 集群正在运行。如果你还没有 Elastic deployment可以注册免费的 Elastic Cloud 试用版。安装软件包并导入模块!python3 -m pip install sentence-transformers2.7.0 eland elasticsearch transformers开始之前你需要安装所有必需的 Python 依赖项。!python3 -m pip install sentence-transformers2.7.0 eland9 elasticsearch9 transformers # 导入模块 from elasticsearch import Elasticsearch from getpass import getpass from urllib.request import urlopen import json from time import sleep部署 NLP 模型我们使用eland工具安装一个text_embedding模型。这里使用all-MiniLM-L6-v2模型将搜索文本转换为 dense vector。该模型会将你的搜索查询转换为向量用于在存储于 Elasticsearch 中的文档集合上执行搜索。安装文本 embedding NLP 模型使用eland_import_hub_model脚本下载并安装all-MiniLM-L6-v2Transformer 模型并将 NLP 的--task-type设置为text_embedding。要获取 Cloud ID请进入 Elastic Cloud在 deployment 概览页面复制 Cloud ID。为了验证请求身份你可以使用 API key。或者也可以使用 Cloud deployment 的用户名和密码。# https://www.elastic.co/search-labs/tutorials/install-elasticsearch/elastic-cloud#finding-your-cloud-id ELASTIC_CLOUD_ID getpass(Elastic Cloud ID: ) # https://www.elastic.co/search-labs/tutorials/install-elasticsearch/elastic-cloud#creating-an-api-key ELASTIC_API_KEY getpass(Elastic Api Key: )!eland_import_hub_model \ --cloud-id $ELASTIC_CLOUD_ID \ --hub-model-id sentence-transformers/all-MiniLM-L6-v2 \ --task-type text_embedding \ --es-api-key $ELASTIC_API_KEY \ --start \ --clear-previous连接到 Elasticsearch 集群使用 deployment 的 Cloud ID 和 API Key 创建一个 Elasticsearch client 实例。在本示例中我们使用上一步中的API_KEY和CLOUD_ID。你也可以使用 deployment 的用户名和密码进行身份验证。es Elasticsearch( cloud_idELASTIC_CLOUD_ID, api_keyELASTIC_API_KEY, request_timeout600 ) es.info() # 应返回集群信息创建 Ingest Pipeline我们需要创建一个文本 embedding ingest pipeline为title字段生成向量文本embedding。下面的 pipeline 定义了一个 processor用于调用 NLP 模型执行 inference。# ingest pipeline 定义 PIPELINE_ID vectorize_blogs es.ingest.put_pipeline( idPIPELINE_ID, processors[ { inference: { model_id: sentence-transformers__all-minilm-l6-v2, target_field: text_embedding, field_map: {title: text_field}, } } ], )创建带有 mapping 的索引现在在索引文档之前我们先创建一个具有正确 mapping 的 Elasticsearch 索引。我们添加text_embedding字段用于包含model_id和predicted_value以存储 embedding。# 定义索引名称 INDEX_NAME blogs # 标志用于检查创建索引前是否删除已有索引 SHOULD_DELETE_INDEX True # 定义索引 mapping INDEX_MAPPING { properties: { title: { type: text, fields: { keyword: { type: keyword, ignore_above: 256 } }, }, text_embedding: { properties: { is_truncated: { type: boolean }, model_id: { type: text, fields: { keyword: { type: keyword, ignore_above: 256 } }, }, predicted_value: { type: dense_vector, dims: 384, index: True, similarity: l2_norm, }, } }, } } INDEX_SETTINGS { index: { number_of_replicas: 1, number_of_shards: 1, default_pipeline: PIPELINE_ID, } } # 检查是否需要在创建索引前删除已有索引 if SHOULD_DELETE_INDEX: if es.indices.exists(indexINDEX_NAME): print(Deleting existing %s % INDEX_NAME) es.indices.delete(indexINDEX_NAME, ignore[400, 404]) print(Creating index %s % INDEX_NAME) es.indices.create( indexINDEX_NAME, mappingsINDEX_MAPPING, settingsINDEX_SETTINGS, ignore[400, 404] )将数据索引到 Elasticsearch现在使用 ingest pipeline 索引示例博客数据。注意在开始索引之前请确保你已经启动训练好的模型 deployment。url https://raw.githubusercontent.com/elastic/elasticsearch-labs/main/notebooks/integrations/hugging-face/blogs.json response urlopen(url) titles json.loads(response.read()) actions [] for title in titles: actions.append({index: {_index: blogs}}) actions.append(title) es.bulk(indexblogs, operationsactions) sleep(5)查询数据集下一步是执行查询搜索相关博客。下面的示例使用我们上传到 Elasticsearch 的sentence-transformers__all-minilm-l6-v2模型对model_text: how to track network connections进行搜索。整个过程只需一次查询尽管内部实际上包含两个步骤。首先查询会使用 NLP 模型为搜索文本生成一个向量然后使用该向量在数据集中执行搜索。最终输出将显示按与搜索查询接近程度排序的文档列表。INDEX_NAME blogs source_fields [id, title] query { field: text_embedding.predicted_value, k: 5, num_candidates: 50, query_vector_builder: { text_embedding: { model_id: sentence-transformers__all-minilm-l6-v2, model_text: how to track network connections, } }, } response es.search( indexINDEX_NAME, fieldssource_fields, knnquery, sourceFalse, ) def show_results(results): for result in results: print( f{result[fields][title]}\n fScore: {result[_score]}\n ) show_results(response.body[hits][hits])输出[Brewing in Beats: Track network connections] Score: 0.5917864 [Machine Learning for Nginx Logs - Identifying Operational Issues with Your Website] Score: 0.40109876 [Data Visualization For Machine Learning] Score: 0.39027885 [Logstash Lines: Introduce integration plugins] Score: 0.36899462 [Keeping up with Kibana: This week in Kibana for November 29th, 2019] Score: 0.35690257原文https://www.elastic.co/search-labs/tutorials/examples/nlp-model-vector-search-elasticsearch

相关新闻

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍 【免费下载链接】RxJavaExtensions RxJava 4.x extra sources, operators and components and ports of many 1.x companion libraries. 项目地址: https://gitcode.com/gh_mirrors/rx…

2026/8/15 1:54:20 阅读更多 →
Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台

Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台

Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台 【免费下载链接】Rofunc 🤖 The Full Process Python Package for Robot Learning from Demonstration and Robot Manipulation 项目地址: https://gitcode.com/gh_mirrors/ro/Rofunc Ro…

2026/8/10 4:09:40 阅读更多 →
5分钟解锁QQ音乐加密音频:qmcdump完全使用指南

5分钟解锁QQ音乐加密音频:qmcdump完全使用指南

5分钟解锁QQ音乐加密音频:qmcdump完全使用指南 【免费下载链接】qmcdump 一个简单的QQ音乐解码(qmcflac/qmc0/qmc3 转 flac/mp3),仅为个人学习参考用。 项目地址: https://gitcode.com/gh_mirrors/qm/qmcdump 还在为QQ音乐…

2026/8/14 22:07:37 阅读更多 →

最新新闻

OpenSubtitlesDownload多实例并发机制详解:批量搜索如何避开限流陷阱

OpenSubtitlesDownload多实例并发机制详解:批量搜索如何避开限流陷阱

OpenSubtitlesDownload多实例并发机制详解:批量搜索如何避开限流陷阱 【免费下载链接】OpenSubtitlesDownload Automatically find and download the right subtitles for your favorite videos! 项目地址: https://gitcode.com/gh_mirrors/op/OpenSubtitlesDownl…

2026/8/16 15:27:35 阅读更多 →
【信息科学与工程学】【数据中心】第二十五篇 云边协同缓存系统设计10

【信息科学与工程学】【数据中心】第二十五篇 云边协同缓存系统设计10

云边协同缓存系统并发需求分析表(续八十七)—— 多设备跨层级缓存协同设计(中心云-边缘云-边缘节点-终端)​ 重点:缓存算法与信创/国产化软硬件的深度适配与优化 编号 类型 领域 基础设施 云计算中的部署 Scale Up/Out/Across/... 场景+问题详细思考(含硬件配置与…

2026/8/16 15:27:35 阅读更多 →
想给iPhone越狱?先花3分钟读懂这张会变脸的iOS越狱兼容清单

想给iPhone越狱?先花3分钟读懂这张会变脸的iOS越狱兼容清单

想给iPhone越狱?先花3分钟读懂这张会变脸的iOS越狱兼容清单 【免费下载链接】Jailbreak iOS 26.4 - 26, 17 - 17.7.5 & iOS 18 - 18.7.3 Jailbreak Tools, Cydia/Sileo/Zebra Tweaks & Jailbreak News Updates || AI Jailbreak Finder 👇 项目…

2026/8/16 15:27:35 阅读更多 →
TranslucentTB 任务栏透明完整指南:5 分钟解锁 5 种效果与智能动态切换

TranslucentTB 任务栏透明完整指南:5 分钟解锁 5 种效果与智能动态切换

TranslucentTB 任务栏透明完整指南:5 分钟解锁 5 种效果与智能动态切换 【免费下载链接】TranslucentTB A lightweight utility that makes the Windows taskbar translucent/transparent. 项目地址: https://gitcode.com/gh_mirrors/tr/TranslucentTB 周末换…

2026/8/16 15:27:35 阅读更多 →
让 AI 自动调用工具:LFM2.5-1.2B-Instruct-4bit 的 Function Calling 完整教程

让 AI 自动调用工具:LFM2.5-1.2B-Instruct-4bit 的 Function Calling 完整教程

让 AI 自动调用工具:LFM2.5-1.2B-Instruct-4bit 的 Function Calling 完整教程 【免费下载链接】LFM2.5-1.2B-Instruct-4bit 项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/LFM2.5-1.2B-Instruct-4bit 如果你想让小模型也能像 ChatGPT 一样自…

2026/8/16 15:27:35 阅读更多 →
Windows任务栏透明化终极指南:TranslucentTB三步让任务栏告别黑条

Windows任务栏透明化终极指南:TranslucentTB三步让任务栏告别黑条

Windows任务栏透明化终极指南:TranslucentTB三步让任务栏告别黑条 【免费下载链接】TranslucentTB A lightweight utility that makes the Windows taskbar translucent/transparent. 项目地址: https://gitcode.com/gh_mirrors/tr/TranslucentTB 每天开机&a…

2026/8/16 15:26:35 阅读更多 →

日新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/16 6:00:23 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/16 6:00:24 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/16 6:00:27 阅读更多 →