监控 AIX 主机
您可以通过 Instana 监控您的主机。 Instana 提供关于主机性能、健康状况和资源利用率的全面洞察,从而实现高效的故障排除、性能优化以及主动问题检测。
配置自定义轮询率
您可以通过在代理配置文件 <agent_install_dir>/etc/instana/configuration.yaml 中使用该 poll_rate 参数,配置 Instana 轮询主机以收集数据和指标的频率,如下例所示:
#Host Sensor Configuration
com.instana.plugin.host:
poll_rate: 1 # values are in seconds. Default value is 1 second. Valid range: 1 to 600 seconds.
系统信息
Instana 从您的 AIX 主机收集全面的系统信息。 在 Instana 仪表板的 "系统 "窗格中查看这些详细信息:
| 参数 | 描述 |
|---|---|
| 操作系统 | 操作系统信息,包含内核版本和系统架构。 |
| CPU | 系统可用的逻辑处理单元。 |
| 内存 | GiB 中的系统内存容量(吉字节)。 |
| 主机名 | AIX 机器的主机名。 |
| FQDN | 标准域名。 这是主机的完整域名,包含子域名和顶级域名。 |
| 系统标识 | Instana 用于管理受监控主机并与资产管理系统关联的唯一标识符。 |
| 主机标识 | 主机网络接口的MAC地址,这是网络适配器的唯一标识符。 |
| 硬件品牌 | 硬件制造商名称。 |
| 硬件型号 | 硬件的型号名称。 |
| 机器序列号 | 机器的序列号。 |
| 虚拟处理器 | Power Hypervisor为 AIX 操作系统调度工作负载时,分配给逻辑分区(LPAR)的逻辑CPU执行单元数量。 该数值代表核心等效处理器,且不包含SMT线程。 |
| 开始于 | 系统启动的时间。 |
系统ID用于与资产管理系统进行关联。 通过配置代理程序的 YAML 文件来启用系统ID收集功能,具体配置示例如下:
"com.instana.plugin.host":
"collectSystemId": true
接口
您可以找到以下详细信息:
- 接口:网络接口和IP地址的列表。
- Instana 代理:该主机的 Instana 代理。
- 进程:主机上正在运行的进程的数量及详细信息。
报告状态
AIX 主机的历史可用性数据展示在 AIX 主机仪表板的 "报告状态 "图表中。 您可以看到三个颜色指示器,用于标识向 Instana 报告的主机状态。
| 状态 | 描述 | 颜色指示器 |
|---|---|---|
| 报告 | 主机已向 Instana 报告,未出现任何中断。 | 绿色 |
| 报告 - 监控问题 | 主机向 Instana 报告了部分中断(例如网络中断或代理监控问题),目前尚未完全恢复可用状态。 | 橙色 |
| 未报告 | 在此期间,主机完全没有向 Instana 进行报告。 | 红色 |
用于在主机仪表板上显示此数据的指标,是基于从监控该主机的代理接收到的消息聚合而得。 若在指定时间段内, Instana 接收到的消息量达到预期消息量的 98% 以上,则该主机被归类为" 报告型"。
例如,如果指标聚合时间窗口为5分钟,且主机的轮询频率为每秒一次, Instana 预计在此时间段内将从该主机接收300条消息。
- 若接收到的消息至少为294条(即300条的98%),则主机状态显示为" 报告中 "。
- 若接收到的消息数少于294但大于0,主机状态将显示为" 报告中 - 监控问题 "。
- 若未收到任何消息,主机状态将显示为 “未报告 ”。
绩效指标
Instana 监控并显示 AIX 主机的全面性能指标。 这些指标为系统资源利用情况提供了详细洞察,包括CPU使用模式、内存分配、磁盘I/O操作、网络接口活动以及进程行为,从而实现高效的性能分析与故障排查。
CPU 使用率:总体
本节显示所有处理器总计的CPU使用率百分比,代表主机上所有CPU资源的综合利用率。 该聚合指标可帮助您快速评估整体系统负载,并识别CPU需求高峰时段。
要在 AIX LPAR环境中收集更精确的CPU使用率数据,必须在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分将 `useMpstat`true 设置为,如下例所示:
com.instana.plugin.host:
useMpstat: true
| 指标 | 描述 | 精度 |
|---|---|---|
| CPU 使用率 | 您所设置时间段内的总CPU使用率(百分比)。 | 1 秒 |
内存使用情况:总体
本节显示 AIX 主机的整体内存使用率百分比,代表当前正在使用的物理内存总量。 该指标可快速概览内存消耗情况,并有助于识别系统中潜在的内存压力。
| 指标 | 描述 | 精度 |
|---|---|---|
| 内存使用率 | 您设置的时间段内内存总使用量的百分比。 | 1 秒 |
used 内存值按以下方式计算: (computational + non-computational) ÷ real total。 该计算同时包含计算内存(由应用程序和操作系统主动使用的内存)与非计算内存(用于缓存及其他可回收用途的内存)。 非计算组件通常占据内存使用量的很大一部分,这意味着高 used 百分比并不一定意味着内存不足。 在 AIX 上进行有效的内存监控和容量规划时,内存 computational 百分比更具参考价值,因为它能反映实际内存压力,并有助于判断系统是否存在过度承诺的情况。CPU负载:峰值
本节监控所选时间段内达到的最大CPU负载,表明系统经历的最高CPU需求水平。 峰值负载测量对容量规划至关重要,因为它揭示了系统利用率的上限,并有助于识别CPU资源可能不足以处理工作负载峰值的时段。
| 指标 | 描述 | 精度 |
|---|---|---|
| 装入 | 所选时间段内记录的最大CPU负载,代表系统中准备就绪或正在运行的进程峰值数量。 | 1 秒 |
平均运行队列 (1h)
本节监控过去一小时内的平均运行队列深度,测量有多少进程正在等待CPU执行时间。 运行队列是CPU竞争的关键指标——数值越高表明更多进程在争夺CPU资源,这可能意味着需要进行性能优化或增加CPU容量。
| 指标 | 描述 | 精度 |
|---|---|---|
| 平均运行队列 (1h) | 过去60分钟内运行队列中的平均进程数。 如果代理运行时间不足60分钟,则显示 Not collected。 |
60 分钟 |
物理 CPU 消耗
物理CPU消耗量表示LPAR实际使用的物理处理器容量,以处理器单元(核心)为单位进行测量,与配置的虚拟处理器数量无关。
| 指标 | 描述 | 精度 |
|---|---|---|
| 物理 CPU 消耗 | 消耗的物理处理器数。 | 1 秒 |
用户会话
本节监控 AIX 主机上的并发用户登录会话,追踪当前有多少用户处于系统活跃登录状态。 该指标有助于管理员监控系统访问情况,识别异常登录模式,并确保符合许可或安全政策。
| 指标 | 描述 | 精度 |
|---|---|---|
| 用户会话 | 主机上并发用户登录会话的数量。 | 1 分钟 |
CPU使用率:总计
本节将总CPU使用率细分为具体类别,展示处理器时间在用户进程、系统操作、I/O等待状态和空闲时间之间的分配情况。
| 指标 | 描述 | 精度 |
|---|---|---|
| 用户 | CPU时间中用于执行用户空间进程(包括应用程序和用户启动的服务)所占的比例。 | 1 秒 |
| 系统 | CPU时间中用于执行内核操作的百分比,包括系统调用、设备驱动程序和核心操作系统功能。 | 1 秒 |
| 等待 | CPU时间中用于等待I/O操作完成的百分比,表明可能存在磁盘或网络瓶颈。 | 1 秒 |
| 空闲 | 处理器处于空闲状态且未等待I/O操作时的CPU时间百分比,表明可用的CPU容量。 | 1 秒 |
CPU 事件
本节监控与CPU相关的系统事件,追踪影响处理器性能和系统响应能力的上下文切换及设备中断。
| 指标 | 描述 | 精度 |
|---|---|---|
| 上下文切换次数 | CPU在进程或线程之间切换的次数。 高数值可能表明多任务处理过度或资源争用。 | 1 秒 |
| 设备中断 | 来自外围设备的硬件中断请求数量,这些请求需要CPU立即处理I/O操作。 | 1 秒 |
CPU负载:平均值
本节追踪随时间变化的平均CPU负载,测量争夺CPU资源的进程数量。 该指标有助于评估系统工作负载,并识别需求高峰期或资源争用时段。
| 指标 | 描述 | 精度 |
|---|---|---|
| CPU 负载 | 1分钟内可运行或等待进程的平均数量,反映系统整体工作负载及CPU资源压力。 | 5 秒 |
物理处理器利用率
本节监控 AIX 逻辑分区(LPAR)中的物理处理器利用率,追踪实际物理CPU消耗情况。
| 指标 | 描述 | 精度 |
|---|---|---|
| 物理 CPU 消耗 | 消耗的物理处理器数。 | 1 秒 |
| 系统管理程序调用 | 物理处理器时间中用于执行虚拟机监控程序调用的百分比。 该功能仅适用于以 root 用户身份进行的部署;否则,该值为 0。 |
1 秒 |
| 侵占的繁忙周期 | 物理处理器在虚拟机监控程序窃取繁忙周期期间的利用率百分比。 | 1 秒 |
| 被盗的空闲周期 | 物理处理器在虚拟机监控程序窃取空闲周期期间的利用率百分比。 | 1 秒 |
默认情况下,不会收集物理处理器利用率指标。 要启用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectPhysicalProcessorUtil: true
该指标同样显示在物理处理器利用率时间序列图表中,可用于分析历史趋势。
单个 CPU 使用率
本节显示每个独立处理器的CPU使用率细分,展示CPU时间在不同执行状态间的分配情况:
| 指标 | 描述 | 精度 |
|---|---|---|
| 用户 | 用户空间进程(应用程序和服务)占用的CPU时间百分比。 | 1 秒 |
| 系统 | 运行内核空间进程(操作系统核心功能)所占用的CPU时间百分比。 | 1 秒 |
| 等待 | CPU时间中用于等待I/O操作完成所占的比例。 | 1 秒 |
| 空闲 | 处理器空闲时的CPU时间百分比。 | 1 秒 |
默认情况下,不会收集单个CPU使用率指标。 要启用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectIndividualCpuMetrics: true
默认情况下,为优化性能并降低系统开销,已禁用各项CPU使用率指标。 这些指标提供了按处理器细分的数据,但在监控具有大量逻辑CPU的系统时可能影响系统性能。 仅在需要时启用此集合。
内存
本节监控 AIX 主机上的内存资源,提供物理内存和虚拟内存使用情况、交换空间分配以及分页活动等指标,以帮助评估内存压力并优化系统性能。
| 指标 | 单元 | 描述 | 精度 |
|---|---|---|---|
| 已用 | % | 当前已分配的物理内存百分比,包含计算内存和非计算内存。 | 1 秒 |
| 计算 | % | 应用程序和操作系统为处理任务而实际使用的内存比例。 | 1 秒 |
| 非计算性 | % | 用于缓存及其他可回收用途的内存比例,该部分内存可在需要时释放。 | 1 秒 |
| 计算 | 字节 | 应用程序和操作系统实际使用的内存总量。 | 1 秒 |
| 非计算性 | 字节 | 用于缓存及其他可回收用途的内存绝对使用量。 | 1 秒 |
| 真正可用 | 字节 | 无需分页或交换即可分配的可用物理内存量。 | 1 秒 |
| 最小文件页阈值(minperm%) | % | 文件页的最小阈值,低于该阈值时,系统可能会从文件页和计算页中回收内存。 | 10 分钟 |
| 已使用的交换内存量 | % | 当前交换空间使用率,数值偏高时表明内存压力较大。 | 1 秒 |
| 虚拟已用 | % | 当前分配的虚拟内存(物理内存加交换空间)所占百分比。 | 1 秒 |
| 交换总量 | 字节 | 系统上配置的交换空间总量。 | 1 秒 |
| 字节量/秒交换 | 字节 | 可用的交换空间量。 | 1 秒 |
| 虚拟总计 | 字节 | 总虚拟内存容量(物理内存加交换空间)。 | 1 秒 |
| 虚拟可用 | 字节 | 可用于分配的虚拟内存量。 | 1 秒 |
| 虚拟活动 | 字节 | 正在运行的进程所占用的活动虚拟内存量。 | 1 秒 |
| page-in(页面调进) | 比率 | 从磁盘读入物理内存的页面数,表明内存需求超过可用RAM。 | 1 秒 |
| page-out(页面调出) | 比率 | 从物理内存写入磁盘的页面数量,表明内存压力及潜在性能影响。 | 1 秒 |
| 页面扫描 | 比率 | 系统扫描的内存页数,用于识别可回收或交换的候选对象。 | 1 秒 |
| 页面错误 | 比率 | 进程访问当前不在物理内存中的内存页时发生的页面故障异常次数。 | 1 秒 |
| 页面回收 | 比率 | 无需磁盘I/O操作即可从空闲列表中回收的内存页数。 | 1 秒 |
所有内存指标均以时间序列图表形式在 Instana 仪表板中可视化呈现,使您能够分析所选时间范围内不同内存组件间的趋势与关联性。
I/O 活动
本节监控系统I/O活动,同时追踪应用程序级操作和物理磁盘I/O。
| 指标 | 描述 | 精度 |
|---|---|---|
| 读取 | 应用程序执行的read和readv系统调用次数,代表可能从缓存中满足或需要磁盘访问的高级文件读取请求。 | 1 秒 |
| 写入 | 应用程序执行的write和writev系统调用次数,代表初始写入缓冲区缓存的高级文件写入请求。 | 1 秒 |
| 块读取 | 采样期间从磁盘设备读取的物理块操作次数,表示实际绕过或未命中缓冲区缓存的磁盘读取I/O操作。 | 1 秒 |
| 块写入 | 磁盘设备上的物理块写入操作次数,包括将数据从缓冲区缓存刷新到持久存储的同步和异步写入操作。 | 1 秒 |
| 非阻塞读取 | 物理块读取操作次数,包含同步和异步I/O操作,可揭示磁盘读取活动的整体模式。 | 1 秒 |
| 非阻塞写入 | 完全绕过文件系统缓冲区缓存的原始I/O写入操作次数,通常用于直接I/O或需要立即写入的数据库操作。 | 1 秒 |
| 逻辑块读取 | 直接从系统缓存中满足的逻辑块读取次数,无需物理磁盘访问,表明读取操作中缓存利用率有效。 | 1 秒 |
| 逻辑块写入 | 逻辑块写入系统缓冲区缓存的次数,这些数据将在稍后异步地刷新到磁盘,有助于评估写入缓冲的有效性。 | 1 秒 |
| 系统调用 | 所有进程发出的系统调用总数 | 1 秒 |
默认情况下,这些指标的收集功能处于启用状态。 要禁用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectIOActivity: false
过程统计
本节监控进程和线程活动,追踪进程状态、执行模式及系统调用活动,以帮助评估工作负载分布并识别调度问题。
| 指标 | 描述 | 精度 |
|---|---|---|
| 进程总数 | 当前系统中所有状态下的进程总数,包括活动、睡眠、停止和空闲进程。 | 1 秒 |
| 可运行 | 等待运行的进程数量,包括既能运行的进程和当前正在CPU上执行的进程。 | 1 秒 |
| 等待的线程数 | 在等待页面加载操作完成期间被阻塞的进程或线程数量,表明内存分页活动。 | 1 秒 |
| 执行的可执行文件数 | 采样期间执行的执行系统调用次数,代表程序执行和替换操作。 | 1 秒 |
| 已执行的派生数 | 采样间隔内执行的fork系统调用次数,代表新进程创建活动。 | 1 秒 |
| 已停止 | 当前处于停止状态的进程数量,通常由作业控制信号或调试会话暂停。 | 1 秒 |
| 正在休眠 | 当前处于睡眠状态的进程数量,这些进程正在等待事件、资源或I/O操作完成。 | 1 秒 |
| 空闲 | 当前处于空闲状态的进程数量,这些进程既无活跃任务可执行,也无需消耗资源。 | 1 秒 |
| Zombie | 已完成执行但仍在进程表中保留条目、且正在等待父进程读取其状态的僵尸进程的数量。 | 1 秒 |
默认情况下,这些指标的收集功能处于启用状态。 要禁用收集功能,请在代理配置文件的主机部分配置以下设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectProcessStatistics: false
磁盘
本节监控物理磁盘性能指标,包括I/O操作、传输速率和使用模式。
| 指标 | 描述 | 精度 |
|---|---|---|
| 磁盘名称 | 物理磁盘设备的名称。 | 10 分钟 |
| 平均传输大小 | 每次磁盘I/O操作平均传输的字节数。 它有助于评估典型的传输规模,并识别工作负载是执行大型顺序操作还是小型随机I/O。 | 5 秒 |
| 忙碌 | 磁盘处于积极传输数据状态的时间占比。 超过30%的数值通常表明存在过度的分页活动或I/O受限进程。 当该值与高CPU使用率(>80%)同时出现时,通常表明系统已超负荷运行,需要及时处理。 | 5 秒 |
| 传输速率 | 每秒完成的数据传输操作次数,代表磁盘的整体事务吞吐量,有助于评估I/O工作负载强度。 | 5 秒 |
| 读取操作数 | 每秒完成的读取传输操作次数,适用于除适配器外的所有存储设备类型,反映磁盘上的读取工作负载强度。 | 5 秒 |
| 写入操作数 | 每秒完成的写入传输操作次数,适用于除适配器外的所有存储设备类型,反映磁盘上的写入工作负载强度。 | 5 秒 |
| 队列满计数 | 每秒磁盘服务队列达到最大容量而无法接受额外请求的频率,表明I/O饱和及潜在性能下降。 | 5 秒 |
| 已传输的数据 | 该时间段内传输的总千字节数,是衡量磁盘数据传输速度的关键指标,但实际性能还取决于磁盘格式和空间使用效率。 | 5 秒 |
| 读取的数据 | 每秒从磁盘读取的字节数,通过监测间隔进行测量,用于追踪读取吞吐量并识别读取密集型工作负载。 | 5 秒 |
| 写入的数据 | 每秒写入磁盘的字节数,通过监测间隔进行测量,用于追踪写入吞吐量并识别高强度写入工作负载。 | 5 秒 |
| Type | 存储设备类型分类,用于识别特定类型的磁盘或存储适配器,以便正确解读性能表现并进行故障排除。 | 10 分钟 |
默认情况下,系统会根据繁忙百分比(从高到低)收集排名前十的磁盘数据。 要收集所有磁盘的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:
com.instana.plugin.host:
collectAllDisks: true # Set false to collect only top 10 disks
物理卷
本节监控物理卷。 物理卷是原始存储设备(磁盘或分区),必须先初始化并添加到卷组中才能使用。
| 指标 | 描述 | 精度 |
|---|---|---|
| 物理卷名 | 分配给物理卷的设备标识符,用于系统引用和管理操作。 | 10 分钟 |
| 总大小 | 物理卷上可分配给卷组的可用原始存储容量总和。 | 10 分钟 |
| 已用大小 | 当前从该物理卷分配给卷组内逻辑卷的存储空间总量。 | 8分钟 |
| 可用大小 | 物理卷上剩余的未分配存储空间,可用于创建新逻辑卷或扩展现有逻辑卷。 | 8分钟 |
| 已用空间 | 当前分配给卷组的物理卷容量百分比。 | 8分钟 |
| 字节量/秒空间 | 可分配给卷组的物理卷容量百分比。 | 8分钟 |
默认情况下,系统将根据容量利用率(从高到低)收集前10个物理卷的数据。 要收集所有物理卷的数据,请在代理配置文件的主机部分配置以下设置:*instanaAgentDir*/etc/instana/configuration.yaml
com.instana.plugin.host:
collectAllVolumeGroups: true # Set false to collect only top 10 physical volumes.
卷组
本节监控卷组。 卷组是由多个物理卷组成的集合,用于创建存储池。
| 指标 | 描述 | 精度 |
|---|---|---|
| 卷组名称 | 为管理和参考目的分配给卷组的唯一标识符。 | 10 分钟 |
| 总大小 | 卷组中可用的总存储容量,代表所有物理卷的总和。 | 10 分钟 |
| 已用大小 | 当前分配给卷组内逻辑卷的存储空间总量。 | 8分钟 |
| 可用大小 | 卷组中剩余的未分配存储空间,可用于创建新的逻辑卷。 | 8分钟 |
| 已用空间 | 当前分配给逻辑卷的卷组容量百分比。 | 8分钟 |
| 字节量/秒空间 | 可用用于分配给新建或扩展逻辑卷的卷组容量百分比。 | 8分钟 |
| 活动物理卷 | 当前在卷组内处于活动状态且可访问的物理卷数量。 | 8分钟 |
| 物理卷 | 卷组中配置的物理卷总数,包括活动卷和非活动卷。 | 8分钟 |
| 逻辑卷 | 当前在卷组中定义的逻辑卷数量。 | 8分钟 |
| 卷组状态 | 卷组的运行状态,指示其处于活动、非活动或变异状态。 | 10 分钟 |
默认情况下,系统会根据容量利用率(由高到低)收集前10个卷组的数据。 要收集所有卷组的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:
com.instana.plugin.host:
collectAllVolumeGroups: true # Set false to collect only top 10 volume groups.
逻辑卷
本节监控逻辑卷。 逻辑卷是在卷组内创建的虚拟块设备,可用于文件系统或原始存储。
| 指标 | 描述 | 精度 |
|---|---|---|
| 卷组名称 | 包含此逻辑卷的卷组名称,用于建立存储池关系。 | 10 分钟 |
| 逻辑卷名 | 为系统引用和管理操作分配给逻辑卷的唯一标识符。 | 10 分钟 |
| 大小 | 分配给逻辑卷的总存储容量,可根据需要动态调整。 | 10 分钟 |
| Type | 逻辑卷类型,用于标识其用途,例如: jfs2、 jfs2log、分页或其他专用功能。 | 10 分钟 |
| 安装点 | 若逻辑卷托管了已挂载的文件系统,则该文件系统可通过挂载点访问。 | 10 分钟 |
| 状态 | 逻辑卷的运行状态,指示其处于打开、关闭、已同步或其他状态。 | 10 分钟 |
默认情况下,系统会根据容量利用率(从高到低)收集前10个逻辑卷的数据。 要收集所有逻辑卷的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:
com.instana.plugin.host:
collectAllLogicalVolumes: true # Set false to collect only top 10 logical volumes.
文件系统
这些指标为文件系统的性能、容量和使用情况提供了洞察,使管理员能够有效地监控和优化存储系统。
| 指标 | 描述 | 精度 |
|---|---|---|
| 可用磁盘空间 | 文件系统上可用的空闲空间量。 | 1 秒 |
| 泄漏量 | 已分配但未使用的空间,被视为泄漏或浪费。 | 1 秒 |
| 容量 | 文件系统的总容量。 | 1 秒 |
| 已用磁盘百分比 | 文件系统中已使用的空间百分比。 | 1 秒 |
| 索引节点使用情况 | 已使用inode(描述文件和目录的数据结构)的百分比。 | 1 秒 |
| 可用索引节点 | 文件系统上可用的空闲i节点数量。 | 1 秒 |
| 读取的字节数/秒 | 从文件系统中读取的字节数。 | 1 秒 |
| 写入的字节数/秒 | 写入文件系统的字节数。 | 1 秒 |
| 读取量/秒 | 每秒读取操作次数。 | 1 秒 |
| 写入量/秒 | 每秒写入操作次数。 | 1 秒 |
| 标记 | 描述 |
|---|---|
| 设备 | 设备的名称。 |
| 安装 | 设备在文件系统层次结构中挂载的位置。 |
| 选项 | 挂载文件系统时使用的选项或参数。 |
| Type | 文件系统的类型。 |
* 总使用量、读取使用量和写入使用量的数据点指标以百分比形式显示磁盘I/O利用率。
* Leaked (指被删除但仍在使用的文件,相当于 capacity - used - free.) 您可以通过以下方式找到这些 lsof | grep deleted文件:
默认情况下, Instana 仅监控本地文件系统。 configuration.yaml 您可以在 file ( *instanaAgentDir*/etc/instana/configuration.yaml) 中列出被监控或被排除的文件系统。
该配置设置的名称即为设备名称,您可从命令 df 输出的第一列中获取该名称。
以下示例展示了被监控的文件系统列表:
com.instana.plugin.host:
filesystems:
- '/dev/hd11admin'
- '/dev/livedump'
- '/dev/hd10opt'
- '/dev/hd2'
以下示例展示了包含或排除的文件系统:
com.instana.plugin.host:
filesystems:
include:
- '/dev/hd11admin'
- '/dev/livedump'
exclude:
- '/dev/hd10opt'
- '/dev/hd2'
默认情况下,系统会根据容量利用率(从高到低)收集前10个文件系统的数据。 要收集所有文件系统的数据,请在代理配置文件(*instanaAgentDir*/etc/instana/configuration.yaml)的主机部分配置以下设置:
com.instana.plugin.host:
collectAllAixFilesystems: true # Set false to collect only top 10 filesystems
NFS 统计信息
网络文件系统( NFS )统计信息可详细展示系统通过网络与远程文件系统交互的方式。 这些统计数据对于理解性能表现、诊断延迟问题以及识别与存储访问或网络行为相关的瓶颈至关重要。
NFS 支持版本 2、版本 3 和版本 4 的客户端与服务器调用。
下列表格描述了可用的 NFS 指标。
NFS 顶级调用表展示了系统中 NFS 活动的高级概览。 它能帮助您快速了解正在处理多少个 NFS 请求,以及其中是否有任何请求失败。
| 指标 | 描述 | 精度 |
|---|---|---|
| 总调用次数 | 该时间段内接收到的 NFS 请求总数。 | 60 秒 |
| 已拒绝调用 | 被拒绝且无法处理的 NFS 请求数量。 | 60 秒 |
| 拒接电话比例 | 被拒绝的 NFS 调用占总调用次数的比例。 | 60 秒 |
NFS 客户端表记录了系统作为客户端时的活动情况,包括向 NFS 服务器发送的请求数量以及遇到的任何错误或拒绝情况。
| 指标 | 描述 | 精度 |
|---|---|---|
| 查找数 | 客户端为查找文件或目录所执行的查找操作次数。 | 60 秒 |
| 读调用数 | 客户端发送的读取请求数量。 | 60 秒 |
| 读取目录调用数 | 读取目录内容的请求次数。 | 60 秒 |
| 读取链接调用数 | 读取符号链接的请求次数。 | 60 秒 |
| 写入 | 客户端执行的写操作次数。 | 60 秒 |
| 写入高速缓存调用数 | 客户端发送的缓存写入操作次数。 | 60 秒 |
| 文件创建次数 | 客户端发起的文件创建请求数量。 | 60 秒 |
| 除去文件调用数 | 请求删除文件的次数。 | 60 秒 |
| 重命名文件调用数 | 客户端发出的文件重命名请求数量。 | 60 秒 |
| 创建目录调用数 | 创建新目录的请求数量。 | 60 秒 |
| 除去目录调用数 | 删除目录的请求数量。 | 60 秒 |
| 获取属性调用数 | 获取文件或目录属性的请求次数。 | 60 秒 |
| 设置属性调用数 | 更新文件或目录属性的请求次数。 | 60 秒 |
| 文件系统统计信息调用数 | 获取文件系统统计信息的请求次数。 | 60 秒 |
| 链接调用数 | 创建硬链接的请求数量。 | 60 秒 |
| 符号链接调用数 | 创建符号链接的请求数量。 | 60 秒 |
| 空调用数 | 用于检查连接性的NULL过程调用次数。 | 60 秒 |
| Root 调用数 | 客户端执行的根操作调用次数。 | 60 秒 |
NFS 服务器日志显示了由服务器接收并处理的 NFS 请求。 它有助于监控服务器性能、追踪错误并识别文件共享操作中的潜在瓶颈。
| 指标 | 描述 | 精度 |
|---|---|---|
| 查找数 | 服务器在该时间段内处理的查询请求数量。 | 60 秒 |
| 读调用数 | 服务器接收到的读取请求数量。 | 60 秒 |
| 写入 | 服务器接收到的写请求数量。 | 60 秒 |
| 读取目录调用数 | 读取目录内容的请求次数。 | 60 秒 |
| 读取链接调用数 | 读取符号链接的请求次数。 | 60 秒 |
| 写入高速缓存调用数 | 服务器处理的缓存写入操作的数量。 | 60 秒 |
| 文件创建次数 | 服务器处理的文件创建请求数量。 | 60 秒 |
| 除去文件调用数 | 请求删除文件的次数。 | 60 秒 |
| 重命名文件调用数 | 服务器处理的文件重命名请求数量。 | 60 秒 |
| 创建目录调用数 | 创建新目录的请求数量。 | 60 秒 |
| 除去目录调用数 | 删除目录的请求数量。 | 60 秒 |
| 获取属性调用数 | 获取文件或目录属性的请求次数。 | 60 秒 |
| 设置属性调用数 | 更新文件或目录属性的请求次数。 | 60 秒 |
| 文件系统统计信息调用数 | 获取文件系统统计信息的请求次数。 | 60 秒 |
| 链接调用数 | 创建硬链接的请求数量。 | 60 秒 |
| 符号链接调用数 | 创建符号链接的请求数量。 | 60 秒 |
| 空调用数 | 用于检查连接性的NULL过程调用次数。 | 60 秒 |
| Root 调用数 | 服务器接收到的根操作调用次数。 | 60 秒 |
默认情况下,不会收集 NFS 的统计信息。 要启用这些功能,您必须在代理配置文件的主机部分进行设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectNfsStatistics: true
仅当挂载了任何 NFS 文件系统时才配置此设置。 否则,收集到的值将为零。
RPC 统计信息
远程过程调用( RPC )是一种核心通信机制,用于使一个系统上的程序能够执行另一个系统上的过程,如同执行本地函数调用一般。 RPC 抽象化网络通信、序列化和传输的复杂性,使分布式组件能够无缝交互。
同时支持面向连接和无连接的 RPC 客户端与服务器调用。
RPC client 该表格显示了从客户端发送到服务器的 RPC 请求。 它有助于监控呼叫成功率、超时情况、重传事件及认证问题,以确保远程过程通信的可靠性。
| 指标 | 描述 | 精度 |
|---|---|---|
| 调用数 | 客户端发送的 RPC 请求数量。 | 60 秒 |
| 调用被服务器拒绝 | RPC 服务器拒绝的客户端请求数量。 | 60 秒 |
| 调用超时 | 客户端调用 RPC 时,在收到服务器响应前超时的次数。 | 60 秒 |
| 重新传输的调用 | 因响应失败或延迟而向服务器重传的 RPC 数据包数量。 | 60 秒 |
| 回复与呼叫不匹配 | 服务器回复与客户端请求不匹配的次数。 | 60 秒 |
| 忙时调用等待时间 | 因服务器繁忙导致客户端需要等待的次数。 | 60 秒 |
| 刷新的认证次数 | 客户端在该时间段内需要重新发送身份验证信息的次数。 | 60 秒 |
RPC 服务器日志显示了由服务器接收并处理的 RPC 请求。 它有助于监控被拒绝的请求、重复调用、数据包错误和可用性问题,以确保可靠的服务器端通信。
| 指标 | 描述 | 精度 |
|---|---|---|
| 调用数 | 服务器接收到的 RPC 请求数量。 | 60 秒 |
| 调用被拒绝 | 服务器拒绝的 RPC 请求数量。 | 60 秒 |
| 重复请求 | 服务器接收到的重复 RPC 请求数量。 | 60 秒 |
| 重复检查 | 从重复请求缓存中处理的 RPC 请求数量。 | 60 秒 |
| 标头格式错误的数据包 | 接收到的 RPC 数据包中存在格式错误的头部,导致处理错误的数量。 | 60 秒 |
| 数据包太短 | 接收到的 RPC 数据包中,因长度不足而无法处理的不完整数据包数量。 | 60 秒 |
| RPC 数据包不可用次数 | 服务器尝试接收数据包但未找到可用数据包的次数。 | 60 秒 |
默认情况下,不会收集 RPC 的统计信息。 要启用这些功能,您必须在代理配置文件的主机部分进行设置(*instanaAgentDir*/etc/instana/configuration.yaml):
com.instana.plugin.host:
collectRpcStatistics: true
仅当挂载了 NFS 文件系统或系统作为 NFS 服务器运行时,才需配置此设置。 否则,收集到的 RPC 统计数据将为零。
网络接口
下表概述了每个接口的网络流量和错误情况。
| 指标 | 描述 | 精度 |
|---|---|---|
| 接口 | 用于通信的网络接口。 | 60 秒 |
| Mac | 网络接口的媒体访问控制(MAC)地址。 | 60 秒 |
| IP | 分配给网络接口的IP地址。 | 60 秒 |
| RX 字节数 | 网络接口每秒接收的总字节数。 | 1 秒 |
| RX 错误 | 在网络接口接收数据时遇到的错误数量。 | 1 秒 |
| TX 字节数 | 网络接口每秒传输的总字节数。 | 1 秒 |
| TX 错误 | 在网络接口上传输数据包时遇到错误。 | 1 秒 |
| 已接收/秒 | 网络接口每秒接收的数据包数量。 | 1 秒 |
| 已发送/秒 | 网络接口每秒传输的数据包数量。 | 1 秒 |
TCP 活动
这些指标可提供有关 TCP 连接活动的洞察,包括已建立的连接、分段传输速率以及错误发生情况。
| 指标 | 描述 | 精度 |
|---|---|---|
| 已建立 | 已建立的 TCP 连接数。 | 1 秒 |
| 打开/秒 | 每秒新建的 TCP 连接数。 | 1 秒 |
| 传入分段数/秒 | 每秒接收的 TCP 分段数。 | 1 秒 |
| 传出分段数/秒 | 每秒发送的 TCP 分段数。 | 1 秒 |
| 既定重置数 | 每秒重置的已建立 TCP 连接所占百分比。 | 1 秒 |
| 传出重置数 | 每秒重置的 TCP 出站连接所占百分比。 | 1 秒 |
| 失败 | 每秒 TCP 连接尝试失败的百分比。 | 1 秒 |
| 错误 | 每秒 TCP 错误的百分比。 | 1 秒 |
| 重新传输 | 每秒 TCP 重传的百分比。 | 1 秒 |
排名靠前的进程列表
这些指标可提供运行进程的详细信息,包括进程ID、名称、CPU使用率、标准化CPU使用率以及内存消耗情况。 顶部进程列表每30秒更新一次,且该列表仅包含占用系统资源的进程。 例如,在过去30秒内CPU使用率超过10%的进程,或内存使用量(RSS)超过512 MB的进程,都会显示在进程顶部列表中。
要创建一个结合了CPU和内存使用量前10名进程的综合列表,请将 combineTopProcesses 设置为 true。 即使进程的CPU使用率低于10%或内存使用量低于512 MB,这些进程仍会被包含在合并列表中。 若同一进程同时出现在CPU使用率前十名和内存使用率前十名列表中,则在合并后的列表中仅计入一次,该合并列表最多包含20个条目。
com.instana.plugin.host:
combineTopProcesses: true
Linuxtop 语义被使用。 100% CPU指的是单个CPU核心的满负荷使用,您可以查询上个月的快照历史记录。 标准化CPU是通过将CPU除以逻辑处理器数量来计算的。
| 指标 | 描述 | 精度 |
|---|---|---|
| PID | 操作系统为每个进程分配的唯一标识符。 | 30 秒 |
| 进程名称 | 应用程序或服务所定义的进程名称。 | 30 秒 |
| PPID | 启动当前进程的父进程ID,显示进程层次结构。 | 30 秒 |
| GID | 指示进程主要组所有权的组标识符。 | 30 秒 |
| UID | 用于标识进程所有者的用户标识符。 | 30 秒 |
| 耗用时间 | 进程自启动以来运行的总时间。 | 30 秒 |
| CPU | 进程消耗的CPU资源量。 | 30 秒 |
| CPU(规范化) | 进程的CPU使用率,经标准化处理后的数值。 | 30 秒 |
| 内存 | 进程所占用的内存量。 | 30 秒 |
健康特征
错误报告事件
在 AIX 系统上,errpt 命令会从错误日志中的条目生成错误报告。 然后将错误报告中的错误作为事件捕获,并发送到 Instana。 传感器会捕获永久错误类型和临时错误类型以及硬件和软件错误类。 您需要通过使用 configuration.yaml 代理文件 (*instanaAgentDir*/etc/instana/configuration.yaml) 来启用该功能,如下例所示:
com.instana.plugin.host:
aixEventsPollRate: 900 # In seconds
故障诊断
在使用 Instana 监控 AIX 主机时,您可能会遇到以下问题:
代理程序崩溃、指标缺失或报告不正确
随着 2026 年 5 月 27 日发布的最新 Instana 代理程序改进,在某些 AIX 部署中,代理程序会出现崩溃、报告不正确或指标缺失的情况。
解决方案:此问题已在代理程序 2026.06.11.1448、启动程序 1.2.55 以及主机传感器 1.1.234 中得到解决。 要解决这些问题,请升级到最新版本。