何时使用EPD分离技术加速多模态模型推理服务
NVIDIA介绍Dynamo框架的Encode-Prefill-Decode解耦技术,在图像密集、短中等输出及量化MoE模型场景下可将首token延迟降低最高5倍,端到端响应提速最高7倍。
NVIDIA介绍Dynamo框架的Encode-Prefill-Decode解耦技术,在图像密集、短中等输出及量化MoE模型场景下可将首token延迟降低最高5倍,端到端响应提速最高7倍。
NVIDIA发布CUDA Rust,提供cuda-oxide(SIMT)与cutile-rs(Tile)两条技术路线,支持原生Rust编写GPU内核并编译至PTX,两项目均处早期阶段。
NVIDIA推出PAIR虚拟推理路由器,可将本地网络中多台设备的算力聚合调用,缓解多智能体并发推理瓶颈。无需修改现有Agent框架,兼容Ollama和LM Studio,支持RTX GPU、DGX Spark及苹果M4+...
本文介绍如何在NVIDIA Jetson边缘设备上部署Nemotron 3.5 Lightning、Qwen3.8-27B等新一代紧凑型推理模型。通过NVFP4量化与推测解码等技术优化推理性能,可实现无需数据中心支持的本...
本文介绍团队使用NVIDIA NemoClaw构建的记忆驱动型"首席助理"智能体,通过维护结构化自我模型分离证据、知识与执行判断,实现跨时间上下文关联、用户意图优先排序及可纠错的反馈机制,并借助NVIDIA OpenSh...
NVIDIA联合微软及合作伙伴在IFA 2026推出多项本地AI加速技术,包括Hermes Agent、OpenClaw等应用简化本地部署、推理速度最高提升1.9倍的新优化,以及智能分配算力的PAIR工具。搭载新款RTX...
NVIDIA推出个人AI路由器PAIR,可将多智能体任务中的推理请求自动调度到局域网内的多台设备(如RTX PC、DGX Spark等),兼容Ollama和LM Studio,无需改造智能体架构即可扩展算力,减少排队等待...
Nvidia发布开源系统PAIR(个人AI路由器),可将复杂AI智能体任务拆分为多个子任务,分配给本地网络中的其他电脑并行处理,从而加速运行或释放主机资源。该系统支持Windows、Mac、Linux,兼容Ollama和...
英伟达宣布以约129.3亿美元收购开源AI平台Hugging Face,旨在扩展其基础设施与全球可及性。英伟达强调收购后Hugging Face仍将保持开放,支持多云、多硬件及各类开源模型,不会绑定英伟达算力,继续服务全...
本文以图像处理管线为例,系统演示了NVIDIA现代CUDA工具链的使用方法。通过六个递进优化步骤:使用Compute Sanitizer与CCCL API排查越界访问漏洞;引入NVTX标注改善Nsight Systems...
NVIDIA与CrowdStrike在隔离环境中评估了一套攻防一体的智能体系统。防御侧采用专为网络安全定制的Nemotron模型,结合CrowdStrike SafeMind平台,通过连续攻防循环自动生成并验证检测规则。...
本文提供了一套AI推理GPU资源规模配置与总拥有成本(TCO)优化的实用框架。文章从使用场景出发,涵盖聊天机器人、AI智能体、内容生成和翻译应用等典型场景,详细梳理了模型选择、并发量、延迟指标、缓存命中率等关键配置要素。...
NVIDIA与CrowdStrike在Fal.Con 2026大会上宣布联合推出SafeMind智能体网络安全系统。该系统基于NVIDIA Nemotron开源模型,融合CrowdStrike多年威胁数据进行后训练,构建...
NVIDIA Omniverse NuRec通过重建真实驾驶场景并为目标车辆配置渲染新的摄像头视图,解决了自动驾驶感知栈跨车型适配的难题。该工具基于3D高斯泼溅技术,支持新视角合成与可复用场景数据标注,开发者无需为每款车...
NVIDIA BioNeMo Agent Toolkit与Anthropic的Claude Science科研工作台完成深度集成,实现了基于多序列比对(MSA)的蛋白质结构预测工作流。该工作流通过MSA Search、O...
NVIDIA发布TensorRT Model Connect,旨在简化开源AI模型从检查点到原生C++推理的部署流程。该工具将部署分为两个阶段:首先通过一条命令从Hugging Face模型ID构建部署包,再由原生C++...
阿里巴巴发布Qwen3.8-Flash-Next模型权重,作为Qwen4架构预览版。该模型为多模态混合专家架构,主模型参数量125B,附加51B N-gram嵌入,每token激活6B参数,原生支持262K上下文窗口,可...
阿里巴巴发布Qwen3.8-Flash-Next模型权重,作为Qwen4架构预览版,该模型为多模态混合专家架构,拥有176B总参数,每个Token激活6B参数,原生支持262K token上下文窗口,可扩展至1M tok...
英伟达发布Jetson Orin Nano 2机器人计算机,面向入门级边缘AI应用。新品在相同外形下推理性能较前代提升2倍,同等性能下功耗降低40%。该产品搭载78 TOPS AI算力、8GB内存及8核Arm CPU,支...
COMPASS是一个统一框架,通过残差强化学习实现跨机器人平台的导航能力迁移。开发者只需定义机器人、场景和导航目标,编码智能体便可自动完成依赖验证、资产准备、烟雾测试、训练启动和检查点评估。以波士顿动力Spot为参考机器...