博客
记录边缘 AI 工程实践和落地经验。
Qwen3.8-27B 实测:RTX 3090 跑 Q4 拿 58 tok/s,Jetson Thor 跑 BF16 只有 4.1 tok/s
同一个 27B 模型,两台机器给出 14 倍的速度差。本文用 RTX 3090(Ollama Q4_K_M)和 Jetson AGX Thor(vLLM BF16)的实测数据,拆解这个差距里有多少来自量化、多少来自内存带宽,以及 Thor 在并发下扳回了什么。
Qwen3.8跑分RTX 3090Jetson ThorvLLMOllama边缘推理内存带宽2×Jetson Thor 跑 DeepSeek-V4-Flash-NVFP4:QSFP28 互联前置测试与真实阻塞点
尝试评估 nvidia/DeepSeek-V4-Flash-NVFP4 是否能在两台 Jetson Thor 上运行。本文记录 QSFP28 链路、SGLang/vLLM 容器、权重访问方式、磁盘空间和多节点启动前置条件,结论是当前环境尚未达到下载和启动 V4-Flash 的最低条件。
DeepSeek-V4-FlashNVFP4Jetson ThorQSFP28SGLangvLLM多节点推理边缘推理DeepSeek 最近开源的 V4-Flash-0731,Jetson Thor 能跑吗?284B MoE 的边缘部署边界
DeepSeek 最近开放权重的 DeepSeek-V4-Flash-0731 是 284B 参数、13B 激活、1M 上下文的 MoE 模型,MIT License。本文基于官方模型卡和 Thor 真机环境,分析它为什么不是 Jetson Thor 单机本地模型,并给出可测替代方案。
DeepSeek-V4DeepSeek-V4-FlashJetson Thor边缘推理MoESGLangvLLM本地部署DeepSeek V4 Flash NVFP4 在 2×Jetson Thor 上的调试记录 1:SGLang 走到 DeepGEMM 前
记录 nvidia/DeepSeek-V4-Flash-NVFP4 在两台 Jetson Thor 上的第一轮真实调试:QSFP28、模型下载、SGLang nightly、KV cache 补丁、Docker runtime 修复,以及最终卡在 DeepGEMM HyperConnection 不支持 Thor sm110。
DeepSeek-V4DeepSeek-V4-FlashNVFP4Jetson ThorSGLangvLLMQSFP28边缘推理Qwen3.8-Max 能在 Jetson Thor 上跑吗?最新 2.4T 模型与边缘硬件实测边界
Qwen3.8-Max 是阿里 Qwen 系列最新旗舰,官方称 2.4T 参数,主打代码与复杂办公任务。本文基于公开资料和 Jetson Thor 真机环境,说明它为什么不是 Thor 本地推理模型,并给出可复现的 Qwen3-8B / Qwen3.6 Thor 测试路线。
Qwen3.8-MaxQwen3-8BJetson Thor边缘推理大模型SGLangllama.cpp本地部署Jetson T2000 vs T3000 vs Orin:2026 边缘 AI 硬件选型指南
NVIDIA Jetson T2000、T3000、AGX Thor 与 Orin 系列该怎么选?结合 TensorRT Edge-LLM、VLM、机器人和本地大模型部署需求,给出 2026 年边缘 AI 硬件选型建议。
JetsonT2000T3000OrinThor边缘 AI机器人VLMTensorRT Edge-LLM硬件选型2026MiniMax H3 在 Jetson AGX Thor 上的早期公开 Benchmark:FL2VA、Ref2VA 与 INT8 ConvRot 测试方案
基于 Thor-JD 真机建立 MiniMax H3 公开 benchmark:覆盖 FL2VA、Ref2VA、T2VA、INT8 ConvRot、生成耗时、输出有效性、显存/内存容量和复现实验脚本。
MiniMax H3Hailuo 3.0Jetson ThorFL2VARef2VAINT8 ConvRotSGLangComfyUIbenchmark边缘AIJetson AGX Thor 官方 LLM 跑分可信吗?我在真实部署环境复测了一次
NVIDIA 官方已经公布 Jetson AGX Thor 上 Llama、Qwen、DeepSeek 与 Qwen2.5-VL 的 vLLM tokens/s 数据。本文在一台真实运行模型服务、检索服务和桌面环境的 Thor 测试机上复测 Qwen2.5-7B,解释官方 benchmark 与真实部署环境为什么会有差距。
JetsonThorLLMVLMvLLMbenchmark边缘推理NVIDIA部署Jetson AGX Thor + Orbbec 3D 相机:本地多模态机器人巡检系统开发实战
基于 NVIDIA Jetson AGX Thor、Orbbec Gemini 345Lg / RealSense D435i、点云、YOLO、VLM、RAG 和本地 LLM 的 3D 机器人巡检项目复盘。
JetsonJetson Thor机器人3D 视觉OrbbecVLMRAG边缘AIJetson Device Skills 正式上线:AGX Orin 64GB 安装与真机测试
NVIDIA 开源 Jetson Device Skills,让 Claude Code 等智能体获得设备原生开发能力。本文记录 AGX Orin 64GB 真机安装与基准测试全过程。
JetsonOrinedge AIClaude CodeNemoClawLLMbenchmarkJetPackagentdeploymentQwable-v1 在 NVIDIA Thor 上的完整部署、测试与评测
从零开始在 NVIDIA Jetson AGX Thor 上部署 Qwable-v1(Qwen3.6-35B MoE + Claude Fable-5 蒸馏):下载、SGLang 服务、Web UI、Agent 闭环测试,全流程真机数据。
JetsonThorQwableLLMSGLangAgentFable-5蒸馏边缘推理部署双节点 NVIDIA DGX Spark 组集群:200GbE 看起来很快,但 NCCL 才说明真相
两台 DGX Spark 通过 200GbE / ConnectX-7 RDMA 直连。原始 ib_write_bw 接近 197 Gb/s,但实际 NCCL 集合通信带宽只有 10 GB/s——本文详细解释两者为何相差如此之大。
DGX SparkNCCLRDMAvLLM多节点200GbERoCE分布式推理大模型ConnectX-7Qwen3.6-27B RTX 3090 vs Jetson Thor 实测:2026年6月最强开源代码模型,两块板子跑出来了
Qwen3.6-27B 在代码 benchmark 上超越 397B MoE 模型,还能装进单张 RTX 3090。本文给出 RTX 3090(Ollama)和 Jetson Thor(llama.cpp)的真实推理数据,以及为什么 Kimi K2.7-Code 等本月热门模型需要完全不同的硬件。
Qwen3.6跑分RTX 3090Jetson Thor大模型Ollamallama.cpp代码边缘推理2026 年小团队边缘 AI 部署清单
边缘硬件上部署 AI 推理系统的实践清单——涵盖硬件选型、模型优化、热管理、监控,以及只有在生产环境才会出现的故障模式。
边缘 AI部署Jetson生产清单TensorRT 用于计算机视觉:Jetson 和桌面 GPU 上推理加速的真实机制
TensorRT 优化实践指南——它做了什么、加速从哪里来、哪些层受益最大,以及在 Jetson 或 RTX GPU 上部署时常见的坑。
TensorRTJetson推理优化计算机视觉部署Qwen3 30B vs Gemma 4 26B RTX 3090 全显存实测
在 RTX 3090 全显存状态下,对 Qwen3 30B 和 Gemma 4 26B 进行头对头实测。Ollama API 真实数据 —— 生成速度、预填充速度、哪个模型在各场景胜出。
Qwen3Gemma4跑分RTX 3090大模型Ollama本地推理Gemma 4 在 RTX 3090 上的三尺寸实测:4B vs 12B vs 26B — 显存不够时会发生什么
在单张 RTX 3090 上实测 Gemma 4 三种尺寸(4B、12B、26B)。揭示 26B 模型因显存溢出导致生成速度暴跌的真实原因,以及 24GB 显卡应该选哪个尺寸。
Gemma4跑分RTX 3090大模型显存Ollama本地推理Gemma 4 12B 推理测试:Jetson AGX Thor vs RTX 3090
Google Gemma 4 12B 多模态模型真机测试:NVIDIA Jetson AGX Thor(边缘 AI)与 RTX 3090(桌面 GPU)对比。实测生成速度、预填充速度与显存占用。
Gemma4测试结果JetsonThorRTX 3090LLM边缘推理llama.cppLocateAnything-3B 实测:RTX 3090 vs Jetson AGX Thor
在 RTX 3090 工作站和 Jetson AGX Thor 边缘设备上对 NVIDIA LocateAnything-3B 视觉语言模型进行真实硬件测试,记录推理速度、显存占用和部署结论。
locateanythingnvidiajetson thorrtx 3090benchmark边缘ai视觉语言模型目标检测Jetson AGX Thor LLM 推理测试(2026):Qwen3.6-35B 和 Qwen2.5-1.5B 真机数据
NVIDIA Jetson AGX Thor 真机推理测试:SGLang 运行 Qwen3.6-35B-A3B FP8、llama.cpp 运行 Qwen2.5-1.5B Q4_K_M。实测生成速度、首 token 延迟和显存占用。
JetsonLLM测试结果边缘推理QwenSGLangllama.cppThorJetson Thor vs Jetson Orin 64GB:本地 LLM 真机测试笔记
Jetson Thor 与 Jetson Orin 64GB 的本地 LLM 实测对比:Qwen 模型、SGLang、Ollama、响应耗时、tokens/s 与实际部署建议。
JetsonThorOrinLLM测试结果QwenSGLangOllamaJetson AGX Orin 64GB LLM 推理测试(2026)
在 Jetson AGX Orin 64GB 上分别测试 Llama 3.1 8B、Qwen2.5 7B 和 Phi-3 Mini,记录推理速度、首 token 延迟和显存占用,并附上实际部署建议。
JetsonLLM边缘推理测试结果Orinllama.cpp