
NPM
公司介绍:
产品详情
科来公司的NPM(Network Performance Monitor)软件是一款面向企业级用户的全栈式网络性能监控与管理解决方案,旨在帮助IT运维团队实现对网络基础设施的端到端可见性,主动发现并解决性能瓶颈,保障业务服务水平协议(SLA)的达成,同时优化网络资源的利用率。该产品整合了多维度数据采集、实时监控、智能分析与自动化报告等核心能力,为用户提供网络健康状态的全面视图,支持从设备、链路到应用的深度性能分析,助力企业构建稳定、高效、可靠的网络环境。
一、核心定位与整体架构
科来NPM的核心定位是企业级网络性能监控与管理的一站式平台,其设计目标是解决传统网络监控工具存在的可见性不足、告警噪声大、分析能力弱等痛点,为IT团队提供从数据采集到决策支持的全流程解决方案。与单一功能的监控工具不同,科来NPM强调多维度数据融合与智能分析,能够实现从宏观网络拓扑到微观数据包的深度洞察,帮助用户快速定位问题根源,而非仅仅发现问题。
科来NPM的整体架构采用分层设计,确保各模块之间的松耦合与高扩展性,主要包括以下五层:
- 数据采集层:作为架构的基础,负责从各类网络设备、链路、应用及云环境中采集多维度性能数据。支持SNMP(v1/v2c/v3)、NetFlow(v5/v9)、sFlow、J-Flow、IPFIX等标准协议,同时集成科来自研的数据包捕获技术,以及API-based采集方式对接云服务(如AWS、Azure)和虚拟化平台(如VMware、Hyper-V)。该层具备高兼容性,可适配主流厂商的网络设备(如华为、华三、思科、Juniper等)及服务器操作系统(Windows、Linux、Unix)。
- 数据处理与存储层:对采集到的原始数据进行清洗、过滤、聚合与标准化处理,去除冗余信息,确保数据的准确性与一致性。存储方面,采用分布式时序数据库(TSDB)存储性能指标数据,支持PB级数据的长期存储与快速查询;同时使用关系型数据库存储配置信息、告警日志等结构化数据,以及非结构化数据库存储数据包捕获文件与深度分析结果。
- 核心分析引擎层:这是科来NPM的智能核心,包含实时计算引擎、异常检测引擎、根因分析引擎三大模块。实时计算引擎负责对流入数据进行实时分析,生成关键性能指标(KPI);异常检测引擎基于机器学习算法(如聚类、回归、时间序列预测)识别网络中的异常行为(如流量突增、延迟升高、丢包率异常);根因分析引擎则通过关联多维度数据(设备状态、链路性能、应用流量),快速定位问题的根本原因(如路由器CPU过载导致的延迟、应用层协议错误导致的丢包)。
- 可视化与展示层:将分析结果以直观的方式呈现给用户,包括自定义仪表盘、拓扑图、趋势曲线、热力图、报表等。用户可根据角色需求(如网络管理员、运维经理、CIO)配置不同的可视化视图,实现从全局到局部的快速切换。该层支持多终端访问(PC端、移动端),确保用户随时随地监控网络状态。
- 集成与API层:提供开放的RESTful API接口,支持与第三方系统(如IT服务管理工具ServiceNow、Jira,网络配置管理工具SolarWinds NCM,日志分析工具ELK Stack等)的集成。同时支持SNMP traps、syslog等方式向外部系统推送告警信息,实现运维流程的自动化闭环。
二、核心功能模块详解
科来NPM的核心功能模块覆盖了网络性能监控的全生命周期,从数据采集到问题解决,每个模块均针对企业级场景进行了深度优化,以下是各模块的详细说明:
1. 多维度网络数据采集模块
该模块是网络性能监控的基础,支持多种采集方式与数据源,确保全面覆盖企业网络的各个层面:
- 设备性能数据采集:通过SNMP协议采集网络设备(路由器、交换机、防火墙、无线AP等)的关键指标,包括CPU利用率、内存使用率、磁盘空间、接口带宽利用率、接口错误率(丢包、CRC错误、冲突等)、设备温度等。支持SNMPv3协议的加密与认证功能,保障数据传输的安全性。
- 流量数据采集:支持NetFlow、sFlow、J-Flow、IPFIX等流量协议,采集网络中的流量信息,包括源IP、目的IP、源端口、目的端口、协议类型、流量大小、数据包数量等。通过流量分析,用户可了解网络中的流量分布、Top Talkers、应用流量占比等关键信息。
- 数据包级采集:集成科来自研的数据包捕获技术,支持对指定链路或设备的数据包进行实时捕获与存储。用户可根据需求设置过滤规则(如IP地址、端口、协议),仅捕获关注的数据包,减少存储开销。捕获的数据包可导出为PCAP格式,用于后续的深度分析(如使用科来Capsa工具进行协议解析)。
- 云与虚拟化环境采集:通过API对接AWS、Azure等公有云平台,采集云实例的CPU、内存、磁盘、网络带宽等性能指标;支持对VMware vSphere、Hyper-V等虚拟化平台的监控,采集虚拟机的资源利用率、虚拟机之间的流量等信息;同时支持对容器化环境(如Docker、Kubernetes)的监控,采集容器的CPU、内存、网络等指标。
- 应用性能数据采集:通过深度数据包检测(DPI)技术识别网络中的应用类型(如HTTP、HTTPS、FTP、SMTP、MySQL、Oracle等),采集应用的响应时间、吞吐量、错误率等指标。支持自定义应用识别规则,满足企业对特定业务应用的监控需求。
2. 实时性能监控模块
该模块提供实时的网络性能视图,帮助用户随时掌握网络的健康状态:
- 全局仪表盘:用户可自定义仪表盘,添加常用的监控指标(如全网带宽利用率、设备在线率、告警数量、应用响应时间等)。仪表盘支持拖拽式布局,用户可根据需求调整组件位置与大小。同时支持多仪表盘切换,满足不同角色的监控需求(如运维人员关注设备性能,经理关注SLA达成情况)。
- 网络拓扑图:自动发现网络中的设备与链路,生成可视化的网络拓扑图。拓扑图支持层级展示(如核心层、汇聚层、接入层),用户可直观了解网络的结构与设备之间的连接关系。拓扑图中的设备状态会实时更新(如绿色表示正常,红色表示故障,黄色表示警告),用户可通过点击设备查看详细的性能指标。
- 链路性能监控:实时监控链路的带宽利用率、丢包率、延迟、抖动等指标。支持对WAN链路的监控,用户可设置链路的带宽阈值,当利用率超过阈值时,系统会发出告警。同时支持链路的历史性能趋势查看,帮助用户分析链路的使用情况。
- 设备性能监控:对网络设备的CPU、内存、磁盘、接口等指标进行实时监控。支持按设备类型(如路由器、交换机)或厂商分类查看设备列表,用户可快速定位性能异常的设备。设备详情页面展示该设备的所有性能指标,以及最近的告警记录与历史趋势。
- 应用性能监控:展示网络中各应用的流量占比、响应时间、吞吐量等指标。用户可查看Top N应用的流量情况,识别占用带宽较多的应用;同时可监控关键业务应用的响应时间,确保应用性能符合SLA要求。支持对应用的历史性能趋势进行分析,帮助用户了解应用性能的变化情况。
3. 智能告警系统模块
该模块实现对网络异常的主动发现与告警,帮助用户及时处理问题,减少 downtime:
- 阈值告警:用户可针对每个监控指标设置阈值(如CPU利用率超过80%、链路丢包率超过5%、应用响应时间超过2秒),当指标超过阈值时,系统会触发告警。支持设置多级阈值(如警告、minor、major、critical),不同级别的告警对应不同的处理优先级。
- 异常检测告警:基于机器学习算法,系统会自动学习网络的正常运行模式,当出现异常行为(如流量突增、延迟异常升高)时,即使未超过预设阈值,系统也会触发告警。异常检测告警可帮助用户发现未知的网络问题,提高监控的全面性。
- 告警通知方式:支持多种告警通知方式,包括电子邮件、短信、SNMP traps、syslog、微信、钉钉等。用户可根据告警级别设置不同的通知方式(如critical告警通过短信与邮件通知,warning告警仅通过邮件通知)。同时支持告警通知的接收人配置,确保相关人员及时收到告警信息。
- 告警关联与抑制:系统会对告警进行关联分析,将相关的告警合并为一个告警事件,减少告警噪声。例如,当路由器故障导致多个接口中断时,系统会仅触发一个路由器故障告警,而非多个接口中断告警。同时支持告警抑制功能,当某个告警触发后,可抑制相关的次要告警,避免信息过载。
- 告警升级规则:用户可设置告警升级规则,当告警在指定时间内未被处理时,系统会自动将告警级别提升,并通知更高层级的管理人员。例如,某个minor告警在1小时内未被处理,系统会将其升级为major告警,并通知部门经理。
- 告警日志管理:系统会记录所有告警事件的详细信息,包括告警时间、告警级别、告警内容、处理状态、处理人等。用户可通过告警日志查询历史告警记录,分析告警的分布情况与处理效率。同时支持告警日志的导出功能,用于审计与报表生成。
4. 深度性能分析模块
该模块提供对网络性能问题的深度分析能力,帮助用户快速定位问题根源:
- 端到端路径分析:支持对指定源IP与目的IP之间的网络路径进行分析,展示路径中的每一跳设备、链路延迟、丢包率等指标。用户可通过路径分析,快速定位路径中的瓶颈节点(如某路由器的延迟过高),以及识别路径中的丢包位置。
- 流量深度分析:对采集到的流量数据进行深度分析,包括流量的时间分布(如高峰时段流量)、协议分布(如TCP、UDP、ICMP占比)、应用分布(如HTTP、HTTPS占比)等。用户可通过流量分析,了解网络中的流量模式,识别异常流量(如DDoS攻击流量)。
- 应用性能分析:对应用的响应时间进行分解,包括网络延迟、服务器处理时间、应用层延迟等。用户可通过应用性能分析,确定应用性能问题的根源(如网络延迟过高、服务器处理缓慢、应用代码问题)。支持对应用的历史性能数据进行对比分析,帮助用户了解应用性能的变化趋势。
- 数据包级分析:对捕获的数据包进行协议解析,展示数据包的详细内容(如TCP头部、HTTP请求/响应、DNS查询/响应等)。用户可通过数据包分析,定位协议层面的问题(如TCP重传、HTTP 500错误、DNS解析失败)。支持对数据包进行过滤与搜索,快速找到关注的数据包。
- 根因分析:系统会自动关联多维度数据(设备性能、链路状态、流量数据、应用性能),对告警事件进行根因分析,并给出可能的问题原因与解决建议。例如,当应用响应时间过长时,系统会分析是否是网络延迟过高、服务器CPU过载或数据库响应缓慢导致,并给出相应的建议。
5. 历史数据管理与报告模块
该模块支持对历史性能数据的存储与分析,帮助用户了解网络性能的长期变化趋势,并生成合规性报告:
- 历史数据存储:采用分布式时序数据库存储历史性能数据,支持自定义数据retention周期(如1个月、3个月、1年、3年)。用户可根据需求设置不同指标的存储周期(如关键指标存储3年,次要指标存储1个月),以平衡存储成本与数据可用性。
- 历史趋势分析:用户可查看任意指标的历史趋势曲线,分析指标的变化情况。支持按时间范围(如最近1小时、最近24小时、最近7天、最近30天)筛选数据,以及按设备、链路、应用等维度进行过滤。历史趋势分析帮助用户识别网络性能的长期变化规律,预测未来的性能瓶颈。
- 自动化报告生成:支持自定义报告模板,用户可选择需要的指标与图表,生成符合需求的报告。系统支持按时间周期(如每日、每周、每月、每季度)自动生成报告,并通过电子邮件发送给指定人员。报告类型包括网络性能总结报告、设备性能报告、应用性能报告、SLA合规性报告等。
- 报告导出与分享:生成的报告可导出为PDF、Excel、CSV、HTML等格式,方便用户进行离线查看与分享。支持将报告上传至云存储(如AWS S3、Azure Blob)或内部文件服务器,实现报告的集中管理。
- SLA合规性报告:针对企业的SLA要求,生成SLA合规性报告,展示网络性能指标(如链路可用性、应用响应时间)是否符合SLA标准。报告中会列出未达标的指标与时间范围,帮助用户改进网络性能,确保SLA的达成。
6. 多租户与行政管理层模块
该模块支持多租户管理与精细化的权限控制,适用于MSPs(Managed Service Providers)或大型企业的多部门场景:
- 多租户管理:支持创建多个租户,每个租户拥有独立的监控数据、仪表盘、告警规则与报告模板。租户之间的数据完全隔离,确保数据的安全性与隐私性。MSPs可通过多租户功能管理多个客户的网络,大型企业可按部门划分租户,实现各部门网络的独立监控。
- 角色-based权限控制:提供多种预设角色(如超级管理员、租户管理员、运维人员、查看人员),每个角色拥有不同的权限。超级管理员可管理所有租户与系统配置;租户管理员可管理本租户的监控配置与用户;运维人员可查看监控数据、处理告警;查看人员仅可查看监控数据与报告。支持自定义角色,用户可根据需求设置角色的权限。
- 用户管理:支持创建与管理用户账号,分配用户到不同的租户与角色。系统支持LDAP/AD集成,可同步企业内部的用户账号,简化用户管理流程。同时支持用户密码策略(如密码复杂度、过期时间),保障账号的安全性。
- 系统配置管理:支持对系统的全局配置进行管理,包括数据采集频率、存储周期、告警规则、报告模板等。系统配置可导出与导入,方便系统的备份与恢复。同时支持系统日志管理,记录所有系统操作(如用户登录、配置修改、告警处理),用于审计与追溯。
- License管理:提供集中式的License管理功能,用户可查看License的有效期、已监控设备数量、剩余授权数量等信息。支持License的升级与扩容,满足企业网络规模增长的需求。
7. 第三方系统集成模块
该模块支持与多种第三方系统的集成,实现运维流程的自动化与协同:
- IT服务管理(ITSM)工具集成:支持与ServiceNow、Jira、Zendesk等ITSM工具集成,当系统触发告警时,可自动在ITSM工具中创建工单,并将告警信息同步至工单中。运维人员可在ITSM工具中处理工单,处理状态会同步回科来NPM系统,实现告警处理的闭环管理。
- 网络配置管理(NCM)工具集成:支持与SolarWinds NCM、ManageEngine NCM等NCM工具集成,当设备配置发生变化时,NCM工具会将配置变更信息同步至科来NPM系统,用户可查看配置变更对网络性能的影响。同时,科来NPM的告警信息可同步至NCM工具,帮助用户快速定位配置问题导致的性能异常。
- 日志分析工具集成:支持与ELK Stack(Elasticsearch、Logstash、Kibana)、Splunk等日志分析工具集成,将科来NPM的告警日志、系统日志同步至日志分析工具,用户可进行跨系统的日志分析,发现潜在的问题。
- 监控工具集成:支持与Prometheus、Grafana等监控工具集成,将科来NPM的性能指标数据导出至Prometheus,通过Grafana进行可视化展示。同时,可将Prometheus的监控数据导入科来NPM系统,实现多监控工具的数据融合。
- RESTful API接口:提供开放的RESTful API接口,支持用户自定义集成需求。通过API接口,用户可获取监控数据、创建告警规则、生成报告等,实现与企业内部系统的深度集成。
三、技术特点与优势
科来NPM凭借其先进的技术架构与丰富的功能,在网络性能监控领域具备以下核心优势:
- 全面的可见性:支持从设备、链路、流量到应用的全栈式监控,提供端到端的网络性能视图。无论是物理设备、虚拟环境还是云平台,科来NPM都能实现全面覆盖,帮助用户消除监控盲区。
- 主动式监控:通过智能告警系统与异常检测技术,实现对网络问题的主动发现与预警。用户无需手动监控,系统会自动识别异常并发出告警,帮助用户在问题影响业务前及时处理。
- 智能分析能力:基于机器学习的异常检测与根因分析引擎,能够快速定位问题根源,减少故障排查时间。系统会自动关联多维度数据,给出问题的可能原因与解决建议,提高运维效率。
- 高扩展性:采用分布式架构,支持横向扩展。随着企业网络规模的增长,用户可通过增加节点来扩展系统的处理能力与存储容量,支持监控 thousands of devices与 tens of thousands of interfaces。
- 易用性:提供直观的可视化界面与自定义仪表盘,用户可快速上手。同时支持多终端访问,确保用户随时随地监控网络状态。系统的配置流程简单,无需复杂的编程知识。
- 安全性:支持SNMPv3加密、角色-based权限控制、用户审计日志等安全功能,保障监控数据的安全性与隐私性。符合 GDPR、HIPAA等合规性要求,适用于金融、医疗、政府等对安全要求较高的行业。
- 开放的集成能力:提供丰富的API接口与第三方系统集成支持,能够与企业现有的运维工具链无缝集成,实现运维流程的自动化与协同。
四、典型应用场景
科来NPM适用于多种行业与场景,以下是几个典型的应用案例:
- 企业园区网络监控:对于大型企业园区网络,科来NPM可监控核心交换机、路由器、无线AP等设备的性能,实时掌握园区网络的带宽利用率、流量分布、应用性能等指标。当出现网络瓶颈(如核心链路带宽过载)或设备故障时,系统会及时发出告警,帮助运维人员快速处理,确保员工的正常办公。
- 数据中心网络管理:数据中心是企业业务的核心,科来NPM可监控数据中心内的服务器、存储设备、网络设备的性能,以及服务器之间的流量、存储区域网络(SAN)的性能等。通过实时监控与分析,用户可优化数据中心的资源利用率,确保业务系统的稳定运行。
- 云与混合云环境监控:随着企业上云趋势的加剧,科来NPM可监控AWS、Azure等公有云平台的云实例性能,以及混合云环境中本地与云之间的链路性能。用户可了解云资源的使用情况,优化云成本,同时确保云应用的性能符合SLA要求。
- 分支办公网络监控:对于拥有多个分支办公的企业,科来NPM可监控总部与分支之间的WAN链路性能(如延迟、丢包率、带宽利用率),以及分支内部的网络设备性能。当WAN链路出现问题时,系统会及时告警,帮助运维人员快速定位问题,确保分支与总部的业务连通性。
- Managed Service Providers(MSPs):MSPs需要管理多个客户的网络,科来NPM的多租户功能可帮助MSPs实现对不同客户网络的独立监控。每个客户拥有自己的监控视图与告警规则,MSPs可通过统一的控制台管理所有客户的网络,提高运维效率。
- 金融行业网络监控:金融行业对网络性能与安全性要求极高,科来NPM可监控核心业务系统(如网上银行、交易系统)的应用性能,确保交易的实时性与可靠性。同时,系统的安全功能可保障监控数据的安全性,符合金融行业的合规性要求。
总结
科来NPM作为一款企业级网络性能监控与管理解决方案,通过全面的可见性、主动的监控能力、智能的分析引擎与开放的集成能力,帮助IT运维团队实现对网络基础设施的高效管理。无论是企业园区网络、数据中心、云环境还是分支办公网络,科来NPM都能提供针对性的监控方案,助力企业构建稳定、高效、可靠的网络环境,保障业务的持续运行。
如需了解更多关于科来NPM软件的详细信息,请访问科来官方网站:
登录后查看
案例介绍
版权/专利









