从入门到精通Inkling多模态输入输出全流程详解附代码示例【免费下载链接】Inkling项目地址: https://ai.gitcode.com/hf_mirrors/thinkingmachines/InklingInkling是一款强大的多模态AI模型能够接受文本、图像和音频输入并生成文本输出。本指南将帮助你快速掌握Inkling的核心功能和使用方法从环境搭建到高级应用让你轻松上手这款全能的AI助手。 什么是InklingInkling是由thinkingmachines开发的通用多模态模型采用66层解码器架构和稀疏混合专家MoE前馈骨干网络总参数达975B活跃参数41B。它支持文本、图像和音频三种输入模态能够处理英语及多种其他语言适用于构建AI驱动的应用程序如智能助手、编码工具、聊天机器人等。Inkling核心特性多模态支持同时处理文本、图像和音频输入高效架构每个token路由到256个专家中的6个加上2个共享专家灵活部署支持多种开源部署方案包括SGLang、vLLM等广泛应用适用于对话系统、指令跟随、代码生成等多种场景⚙️ 快速开始环境搭建1. 克隆仓库首先克隆Inkling项目仓库到本地git clone https://gitcode.com/hf_mirrors/thinkingmachines/Inkling cd Inkling2. 安装依赖Inkling支持多种部署方式这里以Hugging Face Transformers为例pip install transformers accelerate torch3. 验证安装检查模型配置文件是否存在ls -l config.json tokenizer_config.json 文本输入基础基本文本交互使用Inkling进行文本交互非常简单以下是一个基本示例from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer AutoTokenizer.from_pretrained(./) model AutoModelForCausalLM.from_pretrained(./) prompt |message_user||content_text|Hello, what can you do?|end_message||message_model||content_text| inputs tokenizer(prompt, return_tensorspt) outputs model.generate(**inputs, max_new_tokens100) print(tokenizer.decode(outputs[0], skip_special_tokensFalse))特殊标记说明Inkling使用特殊标记来区分不同类型的内容主要包括|message_user|: 用户消息开始|message_model|: 模型消息开始|content_text|: 文本内容开始|end_message|: 消息结束完整的特殊标记列表可以在tokenizer_config.json中查看。️ 图像输入处理图像输入格式Inkling接受任何基于像素的图像格式理想尺寸为40px到4096px之间。处理图像时需要使用特殊标记prompt |message_user| |content_image|https://example.com/image.jpg|end_message| |message_user| |content_text|描述一下这张图片的内容|end_message| |message_model| |content_text|图像编码原理Inkling通过分层补丁编码器处理图像将图像转换为模型可以理解的向量表示。相关配置可以在config.json的vision_config部分找到vision_config: { vision_encoder_type: hmlp, decoder_dmodel: 6144, patch_size: 40, temporal_patch_size: 2, n_channels: 3, n_layers: 4, use_vision_norm: true } 音频输入处理音频输入要求Inkling支持16kHz采样的WAV格式音频理想长度在20分钟以内。音频输入使用|content_audio_input|标记prompt |message_user| |content_audio_input|audio.wav|end_message| |message_user| |content_text|这段音频讲了什么内容|end_message| |message_model| |content_text|音频处理配置音频处理相关配置位于config.json的audio_config部分audio_config: { decoder_dmodel: 6144, n_mel_bins: 80, mel_vocab_size: 16, bias: false, dmel_min_value: -7.0, dmel_max_value: 2.0, use_audio_norm: true, audio_mode: dmel } 高级应用示例多模态综合应用以下示例展示如何同时使用文本和图像输入prompt |message_user| |content_image|https://example.com/chart.jpg|end_message| |message_user| |content_text|分析这张图表并总结关键趋势|end_message| |message_model| |content_text| inputs tokenizer(prompt, return_tensorspt) outputs model.generate(**inputs, max_new_tokens300) print(tokenizer.decode(outputs[0], skip_special_tokensFalse))工具调用功能Inkling支持工具调用功能可以通过特殊标记实现prompt |message_user| |content_text|今天天气怎么样|end_message| |message_model| |content_thinking|我需要调用天气API来获取当前天气信息|end_message| |message_model| |content_invoke_tool_json|{name:get_weather,parameters:{location:Beijing}}|end_message| 模型性能指标Inkling在多个评估基准上表现优异以下是部分关键指标推理能力HLE带工具46.0%GPQA Diamond 87.2%编码能力SWEBench Verified 77.6%SWEBench Pro 54.3%多模态能力MMMU Pro 73.5%Audio MC 56.6%完整评估结果可以在README.md中查看。⚠️ 注意事项与限制1.** 输入大小限制图像尺寸建议在40px到4096px之间音频长度建议不超过20分钟 2.知识截止模型知识限于训练截止前的信息 3.安全考虑在生产环境中建议添加额外的内容过滤和监控 4.性能优化 **对于大规模部署建议使用SGLang或vLLM等优化框架 进一步学习资源官方文档Tinker Cookbook部署指南SGLang recipe模型卡片README.md通过本指南你已经掌握了Inkling多模态模型的基本使用方法和高级应用技巧。无论是构建智能助手、分析多模态数据还是开发创意应用Inkling都能为你提供强大的支持。开始探索这个全能AI模型的无限可能吧【免费下载链接】Inkling项目地址: https://ai.gitcode.com/hf_mirrors/thinkingmachines/Inkling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考