监控 AIX 主机

您可以通过 Instana 监控您的主机。 Instana 提供关于主机性能、健康状况和资源利用率的全面洞察,从而实现高效的故障排除、性能优化以及主动问题检测。

重要提示:Instana、 SaaS、 1.0.314 (2026年2月23日)、Self Hosted 1.0.315 (2026年3月9日)以及 Host sensor 1.1.227 为 AIX 的主机监控功能带来了重大改进。 为确保数据可视化准确无误,并避免指标缺失或不一致,请将 Instana 代理和 Instana 后端升级至最新版本。 有关更新主机代理的说明, 参阅《更新主机代理》。 如果更新后指标仍未在 Instana 界面中显示,请重启代理,并根据网络带宽情况等待10至15分钟。 要了解此版本引入的完整变更内容,请参阅主机传感器发布说明。 有关常见问题及其解决方法的更多信息,请参阅 “故障排除 ”。

配置自定义轮询率

注意:Instana 主机传感器 1.2.1 及更高版本支持配置轮询率,以减少数据摄入量。 此功能在自托管的 Instana 后端 311 及更高版本中受支持。

您可以通过在代理配置文件 <agent_install_dir>/etc/instana/configuration.yaml 中使用该 poll_rate 参数,配置 Instana 轮询主机以收集数据和指标的频率,如下例所示:

#Host Sensor Configuration
com.instana.plugin.host:
  poll_rate: 1 # values are in seconds. Default value is 1 second. Valid range: 1 to 600 seconds.

系统信息

Instana 从您的 AIX 主机收集全面的系统信息。 在 Instana 仪表板的 "系统 "窗格中查看这些详细信息:

参数 描述
操作系统 操作系统信息,包含内核版本和系统架构。
CPU 系统可用的逻辑处理单元。
内存 GiB 中的系统内存容量(吉字节)。
主机名 AIX 机器的主机名。
FQDN 标准域名。 这是主机的完整域名,包含子域名和顶级域名。
系统标识 Instana 用于管理受监控主机并与资产管理系统关联的唯一标识符。
主机标识 主机网络接口的MAC地址,这是网络适配器的唯一标识符。
硬件品牌 硬件制造商名称。
硬件型号 硬件的型号名称。
机器序列号 机器的序列号。
虚拟处理器 Power Hypervisor为 AIX 操作系统调度工作负载时,分配给逻辑分区(LPAR)的逻辑CPU执行单元数量。 该数值代表核心等效处理器,且不包含SMT线程。
开始于 系统启动的时间。

系统ID用于与资产管理系统进行关联。 通过配置代理程序的 YAML 文件来启用系统ID收集功能,具体配置示例如下:

"com.instana.plugin.host": 
  "collectSystemId": true

接口

您可以找到以下详细信息:

  • 接口:网络接口和IP地址的列表。
  • Instana 代理:该主机的 Instana 代理。
  • 进程:主机上正在运行的进程的数量及详细信息。

报告状态

AIX 主机的历史可用性数据展示在 AIX 主机仪表板的 "报告状态 "图表中。 您可以看到三个颜色指示器,用于标识向 Instana 报告的主机状态。

状态 描述 颜色指示器
报告 主机已向 Instana 报告,未出现任何中断。 绿色
报告 - 监控问题 主机向 Instana 报告了部分中断(例如网络中断或代理监控问题),目前尚未完全恢复可用状态。 橙色
未报告 在此期间,主机完全没有向 Instana 进行报告。 红色

用于在主机仪表板上显示此数据的指标,是基于从监控该主机的代理接收到的消息聚合而得。 若在指定时间段内, Instana 接收到的消息量达到预期消息量的 98% 以上,则该主机被归类为" 报告型"

例如,如果指标聚合时间窗口为5分钟,且主机的轮询频率为每秒一次, Instana 预计在此时间段内将从该主机接收300条消息。

  • 若接收到的消息至少为294条(即300条的98%),则主机状态显示为" 报告中 "。
  • 若接收到的消息数少于294但大于0,主机状态将显示为" 报告中 - 监控问题 "。
  • 若未收到任何消息,主机状态将显示为 “未报告 ”。

绩效指标

Instana 监控并显示 AIX 主机的全面性能指标。 这些指标为系统资源利用情况提供了详细洞察,包括CPU使用模式、内存分配、磁盘I/O操作、网络接口活动以及进程行为,从而实现高效的性能分析与故障排查。

CPU 使用率:总体

本节显示所有处理器总计的CPU使用率百分比,代表主机上所有CPU资源的综合利用率。 该聚合指标可帮助您快速评估整体系统负载,并识别CPU需求高峰时段。

要在 AIX LPAR环境中收集更精确的CPU使用率数据,必须在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分将 `useMpstat`true 设置为,如下例所示:

com.instana.plugin.host:
  useMpstat: true
 
指标 描述 精度
CPU 使用率 您所设置时间段内的总CPU使用率(百分比)。 1 秒

内存使用情况:总体

本节显示 AIX 主机的整体内存使用率百分比,代表当前正在使用的物理内存总量。 该指标可快速概览内存消耗情况,并有助于识别系统中潜在的内存压力。

指标 描述 精度
内存使用率 您设置的时间段内内存总使用量的百分比。 1 秒
注: 在 AIX LPAR环境中, used 内存值按以下方式计算: (computational + non-computational) ÷ real total。 该计算同时包含计算内存(由应用程序和操作系统主动使用的内存)与非计算内存(用于缓存及其他可回收用途的内存)。 非计算组件通常占据内存使用量的很大一部分,这意味着高 used 百分比并不一定意味着内存不足。 在 AIX 上进行有效的内存监控和容量规划时,内存 computational 百分比更具参考价值,因为它能反映实际内存压力,并有助于判断系统是否存在过度承诺的情况。

CPU负载:峰值

本节监控所选时间段内达到的最大CPU负载,表明系统经历的最高CPU需求水平。 峰值负载测量对容量规划至关重要,因为它揭示了系统利用率的上限,并有助于识别CPU资源可能不足以处理工作负载峰值的时段。

指标 描述 精度
装入 所选时间段内记录的最大CPU负载,代表系统中准备就绪或正在运行的进程峰值数量。 1 秒

平均运行队列 (1h)

本节监控过去一小时内的平均运行队列深度,测量有多少进程正在等待CPU执行时间。 运行队列是CPU竞争的关键指标——数值越高表明更多进程在争夺CPU资源,这可能意味着需要进行性能优化或增加CPU容量。

指标 描述 精度
平均运行队列 (1h) 过去60分钟内运行队列中的平均进程数。 如果代理运行时间不足60分钟,则显示 Not collected 60 分钟

物理 CPU 消耗

物理CPU消耗量表示LPAR实际使用的物理处理器容量,以处理器单元(核心)为单位进行测量,与配置的虚拟处理器数量无关。

指标 描述 精度
物理 CPU 消耗 消耗的物理处理器数。 1 秒

用户会话

本节监控 AIX 主机上的并发用户登录会话,追踪当前有多少用户处于系统活跃登录状态。 该指标有助于管理员监控系统访问情况,识别异常登录模式,并确保符合许可或安全政策。

指标 描述 精度
用户会话 主机上并发用户登录会话的数量。 1 分钟

CPU使用率:总计

本节将总CPU使用率细分为具体类别,展示处理器时间在用户进程、系统操作、I/O等待状态和空闲时间之间的分配情况。

指标 描述 精度
用户 CPU时间中用于执行用户空间进程(包括应用程序和用户启动的服务)所占的比例。 1 秒
系统 CPU时间中用于执行内核操作的百分比,包括系统调用、设备驱动程序和核心操作系统功能。 1 秒
等待 CPU时间中用于等待I/O操作完成的百分比,表明可能存在磁盘或网络瓶颈。 1 秒
空闲 处理器处于空闲状态且未等待I/O操作时的CPU时间百分比,表明可用的CPU容量。 1 秒

CPU 事件

本节监控与CPU相关的系统事件,追踪影响处理器性能和系统响应能力的上下文切换及设备中断。

指标 描述 精度
上下文切换次数 CPU在进程或线程之间切换的次数。 高数值可能表明多任务处理过度或资源争用。 1 秒
设备中断 来自外围设备的硬件中断请求数量,这些请求需要CPU立即处理I/O操作。 1 秒

CPU负载:平均值

本节追踪随时间变化的平均CPU负载,测量争夺CPU资源的进程数量。 该指标有助于评估系统工作负载,并识别需求高峰期或资源争用时段。

指标 描述 精度
CPU 负载 1分钟内可运行或等待进程的平均数量,反映系统整体工作负载及CPU资源压力。 5 秒

物理处理器利用率

本节监控 AIX 逻辑分区(LPAR)中的物理处理器利用率,追踪实际物理CPU消耗情况。

指标 描述 精度
物理 CPU 消耗 消耗的物理处理器数。 1 秒
系统管理程序调用 物理处理器时间中用于执行虚拟机监控程序调用的百分比。 该功能仅适用于以 root 用户身份进行的部署;否则,该值为 0 1 秒
侵占的繁忙周期 物理处理器在虚拟机监控程序窃取繁忙周期期间的利用率百分比。 1 秒
被盗的空闲周期 物理处理器在虚拟机监控程序窃取空闲周期期间的利用率百分比。 1 秒

默认情况下,不会收集物理处理器利用率指标。 要启用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectPhysicalProcessorUtil: true

该指标同样显示在物理处理器利用率时间序列图表中,可用于分析历史趋势。

单个 CPU 使用率

本节显示每个独立处理器的CPU使用率细分,展示CPU时间在不同执行状态间的分配情况:

指标 描述 精度
用户 用户空间进程(应用程序和服务)占用的CPU时间百分比。 1 秒
系统 运行内核空间进程(操作系统核心功能)所占用的CPU时间百分比。 1 秒
等待 CPU时间中用于等待I/O操作完成所占的比例。 1 秒
空闲 处理器空闲时的CPU时间百分比。 1 秒

默认情况下,不会收集单个CPU使用率指标。 要启用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectIndividualCpuMetrics: true

默认情况下,为优化性能并降低系统开销,已禁用各项CPU使用率指标。 这些指标提供了按处理器细分的数据,但在监控具有大量逻辑CPU的系统时可能影响系统性能。 仅在需要时启用此集合。

内存

本节监控 AIX 主机上的内存资源,提供物理内存和虚拟内存使用情况、交换空间分配以及分页活动等指标,以帮助评估内存压力并优化系统性能。

指标 单元 描述 精度
已用 % 当前已分配的物理内存百分比,包含计算内存和非计算内存。 1 秒
计算 % 应用程序和操作系统为处理任务而实际使用的内存比例。 1 秒
非计算性 % 用于缓存及其他可回收用途的内存比例,该部分内存可在需要时释放。 1 秒
计算 字节 应用程序和操作系统实际使用的内存总量。 1 秒
非计算性 字节 用于缓存及其他可回收用途的内存绝对使用量。 1 秒
真正可用 字节 无需分页或交换即可分配的可用物理内存量。 1 秒
最小文件页阈值(minperm%) % 文件页的最小阈值,低于该阈值时,系统可能会从文件页和计算页中回收内存。 10 分钟
已使用的交换内存量 % 当前交换空间使用率,数值偏高时表明内存压力较大。 1 秒
虚拟已用 % 当前分配的虚拟内存(物理内存加交换空间)所占百分比。 1 秒
交换总量 字节 系统上配置的交换空间总量。 1 秒
字节量/秒交换 字节 可用的交换空间量。 1 秒
虚拟总计 字节 总虚拟内存容量(物理内存加交换空间)。 1 秒
虚拟可用 字节 可用于分配的虚拟内存量。 1 秒
虚拟活动 字节 正在运行的进程所占用的活动虚拟内存量。 1 秒
page-in(页面调进) 比率 从磁盘读入物理内存的页面数,表明内存需求超过可用RAM。 1 秒
page-out(页面调出) 比率 从物理内存写入磁盘的页面数量,表明内存压力及潜在性能影响。 1 秒
页面扫描 比率 系统扫描的内存页数,用于识别可回收或交换的候选对象。 1 秒
页面错误 比率 进程访问当前不在物理内存中的内存页时发生的页面故障异常次数。 1 秒
页面回收 比率 无需磁盘I/O操作即可从空闲列表中回收的内存页数。 1 秒

所有内存指标均以时间序列图表形式在 Instana 仪表板中可视化呈现,使您能够分析所选时间范围内不同内存组件间的趋势与关联性。

I/O 活动

本节监控系统I/O活动,同时追踪应用程序级操作和物理磁盘I/O。

指标 描述 精度
读取 应用程序执行的read和readv系统调用次数,代表可能从缓存中满足或需要磁盘访问的高级文件读取请求。 1 秒
写入 应用程序执行的write和writev系统调用次数,代表初始写入缓冲区缓存的高级文件写入请求。 1 秒
块读取 采样期间从磁盘设备读取的物理块操作次数,表示实际绕过或未命中缓冲区缓存的磁盘读取I/O操作。 1 秒
块写入 磁盘设备上的物理块写入操作次数,包括将数据从缓冲区缓存刷新到持久存储的同步和异步写入操作。 1 秒
非阻塞读取 物理块读取操作次数,包含同步和异步I/O操作,可揭示磁盘读取活动的整体模式。 1 秒
非阻塞写入 完全绕过文件系统缓冲区缓存的原始I/O写入操作次数,通常用于直接I/O或需要立即写入的数据库操作。 1 秒
逻辑块读取 直接从系统缓存中满足的逻辑块读取次数,无需物理磁盘访问,表明读取操作中缓存利用率有效。 1 秒
逻辑块写入 逻辑块写入系统缓冲区缓存的次数,这些数据将在稍后异步地刷新到磁盘,有助于评估写入缓冲的有效性。 1 秒
系统调用 所有进程发出的系统调用总数 1 秒

默认情况下,这些指标的收集功能处于启用状态。 要禁用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectIOActivity: false

过程统计

本节监控进程和线程活动,追踪进程状态、执行模式及系统调用活动,以帮助评估工作负载分布并识别调度问题。

指标 描述 精度
进程总数 当前系统中所有状态下的进程总数,包括活动、睡眠、停止和空闲进程。 1 秒
可运行 等待运行的进程数量,包括既能运行的进程和当前正在CPU上执行的进程。 1 秒
等待的线程数 在等待页面加载操作完成期间被阻塞的进程或线程数量,表明内存分页活动。 1 秒
执行的可执行文件数 采样期间执行的执行系统调用次数,代表程序执行和替换操作。 1 秒
已执行的派生数 采样间隔内执行的fork系统调用次数,代表新进程创建活动。 1 秒
已停止 当前处于停止状态的进程数量,通常由作业控制信号或调试会话暂停。 1 秒
正在休眠 当前处于睡眠状态的进程数量,这些进程正在等待事件、资源或I/O操作完成。 1 秒
空闲 当前处于空闲状态的进程数量,这些进程既无活跃任务可执行,也无需消耗资源。 1 秒
Zombie 已完成执行但仍在进程表中保留条目、且正在等待父进程读取其状态的僵尸进程的数量。 1 秒

默认情况下,这些指标的收集功能处于启用状态。 要禁用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectProcessStatistics: false

磁盘

本节监控物理磁盘性能指标,包括I/O操作、传输速率和使用模式。

指标 描述 精度
磁盘名称 物理磁盘设备的名称。 10 分钟
平均传输大小 每次磁盘I/O操作平均传输的字节数。 它有助于评估典型的传输规模,并识别工作负载是执行大型顺序操作还是小型随机I/O。 5 秒
忙碌 磁盘处于积极传输数据状态的时间占比。 超过30%的数值通常表明存在过度的分页活动或I/O受限进程。 当该值与高CPU使用率(>80%)同时出现时,通常表明系统已超负荷运行,需要及时处理。 5 秒
传输速率 每秒完成的数据传输操作次数,代表磁盘的整体事务吞吐量,有助于评估I/O工作负载强度。 5 秒
读取操作数 每秒完成的读取传输操作次数,适用于除适配器外的所有存储设备类型,反映磁盘上的读取工作负载强度。 5 秒
写入操作数 每秒完成的写入传输操作次数,适用于除适配器外的所有存储设备类型,反映磁盘上的写入工作负载强度。 5 秒
队列满计数 每秒磁盘服务队列达到最大容量而无法接受额外请求的频率,表明I/O饱和及潜在性能下降。 5 秒
已传输的数据 该时间段内传输的总千字节数,是衡量磁盘数据传输速度的关键指标,但实际性能还取决于磁盘格式和空间使用效率。 5 秒
读取的数据 每秒从磁盘读取的字节数,通过监测间隔进行测量,用于追踪读取吞吐量并识别读取密集型工作负载。 5 秒
写入的数据 每秒写入磁盘的字节数,通过监测间隔进行测量,用于追踪写入吞吐量并识别高强度写入工作负载。 5 秒
Type 存储设备类型分类,用于识别特定类型的磁盘或存储适配器,以便正确解读性能表现并进行故障排除。 10 分钟

默认情况下,系统会根据繁忙百分比(从高到低)收集排名前十的磁盘数据。 要收集所有磁盘的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:

com.instana.plugin.host:
  collectAllDisks: true # Set false to collect only top 10 disks

物理卷

本节监控物理卷。 物理卷是原始存储设备(磁盘或分区),必须先初始化并添加到卷组中才能使用。

指标 描述 精度
物理卷名 分配给物理卷的设备标识符,用于系统引用和管理操作。 10 分钟
总大小 物理卷上可分配给卷组的可用原始存储容量总和。 10 分钟
已用大小 当前从该物理卷分配给卷组内逻辑卷的存储空间总量。 8分钟
可用大小 物理卷上剩余的未分配存储空间,可用于创建新逻辑卷或扩展现有逻辑卷。 8分钟
已用空间 当前分配给卷组的物理卷容量百分比。 8分钟
字节量/秒空间 可分配给卷组的物理卷容量百分比。 8分钟

默认情况下,系统将根据容量利用率(从高到低)收集前10个物理卷的数据。 要收集所有物理卷的数据,请在代理配置文件的主机部分配置以下设置:*instanaAgentDir*/etc/instana/configuration.yaml

com.instana.plugin.host:
  collectAllVolumeGroups: true # Set false to collect only top 10 physical volumes.

卷组

本节监控卷组。 卷组是由多个物理卷组成的集合,用于创建存储池。

指标 描述 精度
卷组名称 为管理和参考目的分配给卷组的唯一标识符。 10 分钟
总大小 卷组中可用的总存储容量,代表所有物理卷的总和。 10 分钟
已用大小 当前分配给卷组内逻辑卷的存储空间总量。 8分钟
可用大小 卷组中剩余的未分配存储空间,可用于创建新的逻辑卷。 8分钟
已用空间 当前分配给逻辑卷的卷组容量百分比。 8分钟
字节量/秒空间 可用用于分配给新建或扩展逻辑卷的卷组容量百分比。 8分钟
活动物理卷 当前在卷组内处于活动状态且可访问的物理卷数量。 8分钟
物理卷 卷组中配置的物理卷总数,包括活动卷和非活动卷。 8分钟
逻辑卷 当前在卷组中定义的逻辑卷数量。 8分钟
卷组状态 卷组的运行状态,指示其处于活动、非活动或变异状态。 10 分钟

默认情况下,系统会根据容量利用率(由高到低)收集前10个卷组的数据。 要收集所有卷组的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:

com.instana.plugin.host:
  collectAllVolumeGroups: true # Set false to collect only top 10 volume groups.

逻辑卷

本节监控逻辑卷。 逻辑卷是在卷组内创建的虚拟块设备,可用于文件系统或原始存储。

指标 描述 精度
卷组名称 包含此逻辑卷的卷组名称,用于建立存储池关系。 10 分钟
逻辑卷名 为系统引用和管理操作分配给逻辑卷的唯一标识符。 10 分钟
大小 分配给逻辑卷的总存储容量,可根据需要动态调整。 10 分钟
Type 逻辑卷类型,用于标识其用途,例如: jfs2、 jfs2log、分页或其他专用功能。 10 分钟
安装点 若逻辑卷托管了已挂载的文件系统,则该文件系统可通过挂载点访问。 10 分钟
状态 逻辑卷的运行状态,指示其处于打开、关闭、已同步或其他状态。 10 分钟

默认情况下,系统会根据容量利用率(从高到低)收集前10个逻辑卷的数据。 要收集所有逻辑卷的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:

com.instana.plugin.host:
  collectAllLogicalVolumes: true # Set false to collect only top 10 logical volumes.

文件系统

这些指标为文件系统的性能、容量和使用情况提供了洞察,使管理员能够有效地监控和优化存储系统。

指标 描述 精度
可用磁盘空间 文件系统上可用的空闲空间量。 1 秒
泄漏量 已分配但未使用的空间,被视为泄漏或浪费。 1 秒
容量 文件系统的总容量。 1 秒
已用磁盘百分比 文件系统中已使用的空间百分比。 1 秒
索引节点使用情况 已使用inode(描述文件和目录的数据结构)的百分比。 1 秒
可用索引节点 文件系统上可用的空闲i节点数量。 1 秒
读取的字节数/秒 从文件系统中读取的字节数。 1 秒
写入的字节数/秒 写入文件系统的字节数。 1 秒
读取量/秒 每秒读取操作次数。 1 秒
写入量/秒 每秒写入操作次数。 1 秒
标记 描述
设备 设备的名称。
安装 设备在文件系统层次结构中挂载的位置。
选项 挂载文件系统时使用的选项或参数。
Type 文件系统的类型。

* 总使用量、读取使用量和写入使用量的数据点指标以百分比形式显示磁盘I/O利用率。

* Leaked (指被删除但仍在使用的文件,相当于 capacity - used - free.) 您可以通过以下方式找到这些 lsof | grep deleted文件:

默认情况下, Instana 仅监控本地文件系统。 configuration.yaml 您可以在 file ( *instanaAgentDir*/etc/instana/configuration.yaml) 中列出被监控或被排除的文件系统。

该配置设置的名称即为设备名称,您可从命令 df 输出的第一列中获取该名称。

以下示例展示了被监控的文件系统列表:

com.instana.plugin.host:
  filesystems:
    - '/dev/hd11admin'
    - '/dev/livedump'
    - '/dev/hd10opt'
    - '/dev/hd2'
 

以下示例展示了包含或排除的文件系统:

com.instana.plugin.host:
  filesystems:
    include:
      - '/dev/hd11admin'
      - '/dev/livedump'
    exclude:
      - '/dev/hd10opt'
      - '/dev/hd2'
 

默认情况下,系统会根据容量利用率(从高到低)收集前10个文件系统的数据。 要收集所有文件系统的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:

com.instana.plugin.host:
  collectAllAixFilesystems: true # Set false to collect only top 10 filesystems

NFS 统计信息

网络文件系统( NFS )统计信息可详细展示系统通过网络与远程文件系统交互的方式。 这些统计数据对于理解性能表现、诊断延迟问题以及识别与存储访问或网络行为相关的瓶颈至关重要。

NFS 支持版本 2、版本 3 和版本 4 的客户端与服务器调用。

下列表格描述了可用的 NFS 指标。

NFS 顶级调用表展示了系统中 NFS 活动的高级概览。 它能帮助您快速了解正在处理多少个 NFS 请求,以及其中是否有任何请求失败。

指标 描述 精度
总调用次数 该时间段内接收到的 NFS 请求总数。 60 秒
已拒绝调用 被拒绝且无法处理的 NFS 请求数量。 60 秒
拒接电话比例 被拒绝的 NFS 调用占总调用次数的比例。 60 秒

NFS 客户端表记录了系统作为客户端时的活动情况,包括向 NFS 服务器发送的请求数量以及遇到的任何错误或拒绝情况。

指标 描述 精度
查找数 客户端为查找文件或目录所执行的查找操作次数。 60 秒
读调用数 客户端发送的读取请求数量。 60 秒
读取目录调用数 读取目录内容的请求次数。 60 秒
读取链接调用数 读取符号链接的请求次数。 60 秒
写入 客户端执行的写操作次数。 60 秒
写入高速缓存调用数 客户端发送的缓存写入操作次数。 60 秒
文件创建次数 客户端发起的文件创建请求数量。 60 秒
除去文件调用数 请求删除文件的次数。 60 秒
重命名文件调用数 客户端发出的文件重命名请求数量。 60 秒
创建目录调用数 创建新目录的请求数量。 60 秒
除去目录调用数 删除目录的请求数量。 60 秒
获取属性调用数 获取文件或目录属性的请求次数。 60 秒
设置属性调用数 更新文件或目录属性的请求次数。 60 秒
文件系统统计信息调用数 获取文件系统统计信息的请求次数。 60 秒
链接调用数 创建硬链接的请求数量。 60 秒
符号链接调用数 创建符号链接的请求数量。 60 秒
空调用数 用于检查连接性的NULL过程调用次数。 60 秒
Root 调用数 客户端执行的根操作调用次数。 60 秒

NFS 服务器日志显示了由服务器接收并处理的 NFS 请求。 它有助于监控服务器性能、追踪错误并识别文件共享操作中的潜在瓶颈。

指标 描述 精度
查找数 服务器在该时间段内处理的查询请求数量。 60 秒
读调用数 服务器接收到的读取请求数量。 60 秒
写入 服务器接收到的写请求数量。 60 秒
读取目录调用数 读取目录内容的请求次数。 60 秒
读取链接调用数 读取符号链接的请求次数。 60 秒
写入高速缓存调用数 服务器处理的缓存写入操作的数量。 60 秒
文件创建次数 服务器处理的文件创建请求数量。 60 秒
除去文件调用数 请求删除文件的次数。 60 秒
重命名文件调用数 服务器处理的文件重命名请求数量。 60 秒
创建目录调用数 创建新目录的请求数量。 60 秒
除去目录调用数 删除目录的请求数量。 60 秒
获取属性调用数 获取文件或目录属性的请求次数。 60 秒
设置属性调用数 更新文件或目录属性的请求次数。 60 秒
文件系统统计信息调用数 获取文件系统统计信息的请求次数。 60 秒
链接调用数 创建硬链接的请求数量。 60 秒
符号链接调用数 创建符号链接的请求数量。 60 秒
空调用数 用于检查连接性的NULL过程调用次数。 60 秒
Root 调用数 服务器接收到的根操作调用次数。 60 秒

默认情况下,不会收集 NFS 的统计信息。 要启用这些功能,您必须在代理配置文件的主机部分进行设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectNfsStatistics: true

仅当挂载了任何 NFS 文件系统时才配置此设置。 否则,收集到的值将为零。

RPC 统计信息

远程过程调用( RPC )是一种核心通信机制,用于使一个系统上的程序能够执行另一个系统上的过程,如同执行本地函数调用一般。 RPC 抽象化网络通信、序列化和传输的复杂性,使分布式组件能够无缝交互。

同时支持面向连接和无连接的 RPC 客户端与服务器调用。

RPC client 该表格显示了从客户端发送到服务器的 RPC 请求。 它有助于监控呼叫成功率、超时情况、重传事件及认证问题,以确保远程过程通信的可靠性。

指标 描述 精度
调用数 客户端发送的 RPC 请求数量。 60 秒
调用被服务器拒绝 RPC 服务器拒绝的客户端请求数量。 60 秒
调用超时 客户端调用 RPC 时,在收到服务器响应前超时的次数。 60 秒
重新传输的调用 因响应失败或延迟而向服务器重传的 RPC 数据包数量。 60 秒
回复与呼叫不匹配 服务器回复与客户端请求不匹配的次数。 60 秒
忙时调用等待时间 因服务器繁忙导致客户端需要等待的次数。 60 秒
刷新的认证次数 客户端在该时间段内需要重新发送身份验证信息的次数。 60 秒

RPC 服务器日志显示了由服务器接收并处理的 RPC 请求。 它有助于监控被拒绝的请求、重复调用、数据包错误和可用性问题,以确保可靠的服务器端通信。

指标 描述 精度
调用数 服务器接收到的 RPC 请求数量。 60 秒
调用被拒绝 服务器拒绝的 RPC 请求数量。 60 秒
重复请求 服务器接收到的重复 RPC 请求数量。 60 秒
重复检查 从重复请求缓存中处理的 RPC 请求数量。 60 秒
标头格式错误的数据包 接收到的 RPC 数据包中存在格式错误的头部,导致处理错误的数量。 60 秒
数据包太短 接收到的 RPC 数据包中,因长度不足而无法处理的不完整数据包数量。 60 秒
RPC 数据包不可用次数 服务器尝试接收数据包但未找到可用数据包的次数。 60 秒

默认情况下,不会收集 RPC 的统计信息。 要启用这些功能,您必须在代理配置文件的主机部分进行设置(*instanaAgentDir*/etc/instana/configuration.yaml):

com.instana.plugin.host:
  collectRpcStatistics: true

仅当挂载了 NFS 文件系统或系统作为 NFS 服务器运行时,才需配置此设置。 否则,收集到的 RPC 统计数据将为零。

网络接口

下表概述了每个接口的网络流量和错误情况。

指标 描述 精度
接口 用于通信的网络接口。 60 秒
Mac 网络接口的媒体访问控制(MAC)地址。 60 秒
IP 分配给网络接口的IP地址。 60 秒
RX 字节数 网络接口每秒接收的总字节数。 1 秒
RX 错误 在网络接口接收数据时遇到的错误数量。 1 秒
TX 字节数 网络接口每秒传输的总字节数。 1 秒
TX 错误 在网络接口上传输数据包时遇到错误。 1 秒
已接收/秒 网络接口每秒接收的数据包数量。 1 秒
已发送/秒 网络接口每秒传输的数据包数量。 1 秒

TCP 活动

这些指标可提供有关 TCP 连接活动的洞察,包括已建立的连接、分段传输速率以及错误发生情况。

指标 描述 精度
已建立 已建立的 TCP 连接数。 1 秒
打开/秒 每秒新建的 TCP 连接数。 1 秒
传入分段数/秒 每秒接收的 TCP 分段数。 1 秒
传出分段数/秒 每秒发送的 TCP 分段数。 1 秒
既定重置数 每秒重置的已建立 TCP 连接所占百分比。 1 秒
传出重置数 每秒重置的 TCP 出站连接所占百分比。 1 秒
失败 每秒 TCP 连接尝试失败的百分比。 1 秒
错误 每秒 TCP 错误的百分比。 1 秒
重新传输 每秒 TCP 重传的百分比。 1 秒

排名靠前的进程列表

这些指标可提供运行进程的详细信息,包括进程ID、名称、CPU使用率、标准化CPU使用率以及内存消耗情况。 顶部进程列表每30秒更新一次,且该列表仅包含占用系统资源的进程。 例如,在过去30秒内CPU使用率超过10%的进程,或内存使用量(RSS)超过512 MB的进程,都会显示在进程顶部列表中。

要创建一个结合了CPU和内存使用量前10名进程的综合列表,请将 combineTopProcesses 设置为 true。 即使进程的CPU使用率低于10%或内存使用量低于512 MB,这些进程仍会被包含在合并列表中。 若同一进程同时出现在CPU使用率前十名和内存使用率前十名列表中,则在合并后的列表中仅计入一次,该合并列表最多包含20个条目。

com.instana.plugin.host:
  combineTopProcesses: true
 

Linuxtop 语义被使用。 100% CPU指的是单个CPU核心的满负荷使用,您可以查询上个月的快照历史记录。 标准化CPU是通过将CPU除以逻辑处理器数量来计算的。

指标 描述 精度
PID 操作系统为每个进程分配的唯一标识符。 30 秒
进程名称 应用程序或服务所定义的进程名称。 30 秒
PPID 启动当前进程的父进程ID,显示进程层次结构。 30 秒
GID 指示进程主要组所有权的组标识符。 30 秒
UID 用于标识进程所有者的用户标识符。 30 秒
耗用时间 进程自启动以来运行的总时间。 30 秒
CPU 进程消耗的CPU资源量。 30 秒
CPU(规范化) 进程的CPU使用率,经标准化处理后的数值。 30 秒
内存 进程所占用的内存量。 30 秒

健康特征

对于每个传感器,系统会持续将健康特征知识库与接收到的指标数据进行比对评估。 它们用于根据用户影响程度来报告问题或事件。

内置事件会根据实体的健康指标异常触发问题或事件,而自定义事件则会根据实体某项指标的阈值触发问题或事件。

有关主机传感器内置事件的更多信息,请参阅内置事件参考

错误报告事件

在 AIX 系统上,errpt 命令会从错误日志中的条目生成错误报告。 然后将错误报告中的错误作为事件捕获,并发送到 Instana。 传感器会捕获永久错误类型和临时错误类型以及硬件和软件错误类。 您需要通过使用 configuration.yaml 代理文件 (*instanaAgentDir*/etc/instana/configuration.yaml) 来启用该功能,如下例所示:

com.instana.plugin.host:
  aixEventsPollRate: 900 # In seconds
 

故障诊断

在使用 Instana 监控 AIX 主机时,您可能会遇到以下问题:

代理程序崩溃、指标缺失或报告不正确

随着 2026 年 5 月 27 日发布的最新 Instana 代理程序改进,在某些 AIX 部署中,代理程序会出现崩溃、报告不正确或指标缺失的情况。

解决方案:此问题已在代理程序 2026.06.11.1448、启动程序 1.2.55 以及主机传感器 1.1.234 中得到解决。 要解决这些问题,请升级到最新版本。