Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试
Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型采用 Mixture-of-ExpertsMoETransformer 架构支持文本、图像和音频等多模态输入并生成文本输出。模型拥有约 975B 总参数、41B 激活参数并支持最长 1M token 上下文窗口。在能力方面Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化同时支持 MTPMulti-Token Prediction等推理加速技术可结合 vLLM、SGLang 等主流推理引擎进行部署。1. 登录 GPUStack 选择推理后端测试环境8 × H20-141G2. 添加版本点击添加版本Add Version镜像名称vllm/vllm-openai:nightly3. 点击部署开始部署Node 0 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/Node 1 参数--trust-remote-code --tokenizer-modeinkling --kernel-config.enable_flashinfer_autotuneFalse --tensor-parallel-size8--data-parallel-size2--data-parallel-size-local1--data-parallel-start-rank1--enable-expert-parallel --data-parallel-rpc-port13389--data-parallel-address10.91.3.213 --data-parallel-hybrid-lb --max-model-len131072--max-num-seqs10--enable-auto-tool-choice --tool-call-parserinkling --speculative-config{method:mtp,num_speculative_tokens:1}--reasoning-parserinkling环境变量PYPI_PACKAGES_INSTALLscipy1.18.0-ihttps://mirrors.aliyun.com/pypi/simple/模型进入 Running 状态后可以直接通过 GPUStack 试验场进行交互测试。在默认配置下Inkling 输出速度达到80 Tokens/s能够正常完成多轮文本对话并支持思考过程解析。同时支持原生多模态能力。4. 测评测试配置Input Length64KOutput Length3KRequests10测试结果如下指标结果Output Token Throughput56.10 tok/sPeak Output Throughput78.00 tok/sTotal Token Throughput1253.09 tok/sMean TTFT92.77sMean TPOT97.09 ms/token在长上下文输入场景下Inkling 可以稳定完成 64K 上下文推理任务并保持持续输出能力。

相关新闻

计算机毕业设计之智慧校园出行平台

计算机毕业设计之智慧校园出行平台

快速发展的社会中,人们的生活水平都在提高,生活节奏也在逐渐加快。为了节省时间和提高工作效率,越来越多的人选择利用互联网进行线上打理各种事务,然后线上管理系统也就相继涌现。与此同时,人们开始接受方便的生活方式…

2026/7/22 15:25:53 阅读更多 →
本地部署通义千问Qwen3与WinClaw智能网关集成指南

本地部署通义千问Qwen3与WinClaw智能网关集成指南

1. 项目概述最近在折腾一个挺有意思的项目——把阿里云的通义千问Qwen3大模型接入到WinClaw这个Windows平台上的智能网关工具里。WinClaw其实是OpenClaw的Windows适配版本,主要功能是作为大语言模型和本地系统操作之间的桥梁。简单来说,就是让AI不仅能跟…

2026/7/22 15:25:53 阅读更多 →
(Python基础教程之十七)Python OrderedDict –有序字典

(Python基础教程之十七)Python OrderedDict –有序字典

一个OrderedDict 维护插入顺序添加到字典中的项目。项目的顺序在迭代或序列化时也会保留。 1. Python OrderedDict示例 OrderedDict 是python collections模块的一部分。 要轻松构建OrderedDict,可以OrderedDict在collections模块中使用。 OrderedDictExample.py from col…

2026/7/22 15:25:53 阅读更多 →

最新新闻

MT6357的耳机插入过程中accdet机制及代码分析

MT6357的耳机插入过程中accdet机制及代码分析

文章目录前言一、设备树及原理图二、accdet机制三、mt6357-accdet.c 代码分析3.1 mtk_accdet_irq_handler_thread代码分析3.2 eint_work_callback分析3.3 accdet_work_callback3.4 dis_micbias_timerhandler3.5 dis_micbias_work_callback3.6 delay_init_timerhandler和delay_i…

2026/7/22 16:10:27 阅读更多 →
笔记本KVM虚拟机VFIO显卡直通完整教程

笔记本KVM虚拟机VFIO显卡直通完整教程

1. 项目概述在Linux环境下运行Windows应用程序一直是许多用户的痛点,尤其是对于游戏玩家和专业软件用户而言。传统的兼容层方案如Wine和Proton虽然取得了一定进展,但在性能和兼容性方面仍存在局限。而虚拟机方案虽然兼容性更好,却常因图形性能…

2026/7/22 16:10:27 阅读更多 →
Alfred高效工作流:从基础搜索到深度定制

Alfred高效工作流:从基础搜索到深度定制

1. Alfred 核心功能解析 Alfred作为macOS平台上的效率神器,其核心价值在于将分散的系统操作整合为统一的指令入口。我使用Alfred五年多,最深体会是它彻底改变了我的工作流结构——通过CommandSpace这组全局快捷键,可以瞬间唤醒搜索框&#x…

2026/7/22 16:10:27 阅读更多 →
C/C++内存管理进阶:从栈堆原理到智能指针实战

C/C++内存管理进阶:从栈堆原理到智能指针实战

1. 项目概述:为什么内存管理是C/C的“成人礼”干了这么多年C/C开发,我越来越觉得,内存管理这门手艺,是区分“会用C”和“懂C”的一道分水岭。新手入门,往往被语法、循环、类这些概念吸引,写得飞起。但一到项…

2026/7/22 16:10:27 阅读更多 →
TI PSC控制器详解:嵌入式低功耗电源管理的核心机制与实战

TI PSC控制器详解:嵌入式低功耗电源管理的核心机制与实战

1. 项目概述与核心价值在嵌入式开发,尤其是电池供电或对功耗极其敏感的应用场景里,电源管理从来都不是一个“锦上添花”的选项,而是决定产品成败的基石。我经历过不少项目,早期因为对电源管理理解不深,要么是设备续航远…

2026/7/22 16:10:27 阅读更多 →
【JAVA毕设源码分享】基于springboot自行车仓库管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot自行车仓库管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/22 16:09:26 阅读更多 →

日新闻

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

TI DSP系统配置模块SYSCFG详解:中断机制与主设备优先级配置实战

1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…

2026/7/22 0:00:26 阅读更多 →
微信Server酱:高到达率的应急通知方案实践

微信Server酱:高到达率的应急通知方案实践

1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…

2026/7/22 0:00:26 阅读更多 →
甲方要的“简洁“PPT,到底是简洁还是省事?

甲方要的“简洁“PPT,到底是简洁还是省事?

甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…

2026/7/22 0:00:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻