> ## Documentation Index
> Fetch the complete documentation index at: https://dragonwingdocs.qualcomm.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 运行时性能调优

Qualcomm<sup>®</sup> Linux 提供 sysfs 接口、内核参数和设备树控制项来调优运行时性能。本页涵盖 CPU 频率调节、内存子系统调节项、块 I/O 调度、Qualcomm 特有的 DCVS 和 DDR 带宽控制,以及硬件性能分析。

## **CPU 性能调优**

### 选择 CPU 频率调速器

Qualcomm Linux 使用 `schedutil` 作为默认的 CPUfreq 调速器,每个 CPU 簇一个策略。QCS6490 有三个簇:小核(cpu0–cpu3,Cortex-A55)、大核(cpu4–cpu6,Cortex-A78)和超大核(cpu7,Cortex-A78)。IQ-9075 有四个簇。

读取所有策略的当前调速器:

```bash theme={null}
cat /sys/devices/system/cpu/cpufreq/policy*/scaling_governor
```

更改所有策略的调速器:

```bash theme={null}
# Maximum throughput, disables frequency scaling
for p in /sys/devices/system/cpu/cpufreq/policy*/; do
    echo performance > "${p}scaling_governor"
done

# Restore adaptive scheduling
for p in /sys/devices/system/cpu/cpufreq/policy*/; do
    echo schedutil > "${p}scaling_governor"
done
```

**表:CPUfreq sysfs 频率控制项**

| sysfs 路径                           | 说明              |
| ---------------------------------- | --------------- |
| `cpufreq/policyN/scaling_max_freq` | 簇 N 的最大频率上限(Hz) |
| `cpufreq/policyN/scaling_min_freq` | 簇 N 的最小频率下限(Hz) |
| `cpufreq/policyN/scaling_cur_freq` | 当前选定的频率(只读)     |
| `cpufreq/policyN/cpuinfo_max_freq` | 硬件最大频率(只读)      |

路径相对于 `/sys/devices/system/cpu/`。

### 调优 schedutil 响应性

`rate_limit_us` 可调参数防止 schedutil 以短于指定间隔(微秒)的频率更改频率。较低的值以更多的频率切换为代价提高响应性:

```bash theme={null}
echo 200 > /sys/devices/system/cpu/cpufreq/policy4/schedutil/rate_limit_us
```

有关能耗感知调度(EAS)、利用率钳制(uclamp)和 CPU 拓扑详情,请参阅[配置调度器](./configure-the-scheduler)。

## **CPU 隔离与 IRQ 亲和性**

对于实时音频或确定性传感器管线等延迟敏感的工作负载,可以将 CPU 从通用调度器中隔离出来,并将中断重定向到其他 CPU。

### 在启动时隔离 CPU

在内核命令行中添加以下参数:

```bash theme={null}
isolcpus=6,7 rcu_nocbs=6,7 nohz_full=6,7 irqaffinity=0-5
```

<Note>
  `isolcpus` 是静态的启动时机制。要在不重启的情况下动态隔离 CPU,请使用 `cgroup cpuset`。
</Note>

### 在运行时配置 IRQ 亲和性

列出所有 IRQ 及其当前的 CPU 亲和性:

```bash theme={null}
for i in /proc/irq/*/smp_affinity_list; do
    echo "$i: $(cat $i)"
done
```

将特定 IRQ 移到指定 CPU:

```bash theme={null}
echo 4 > /proc/irq/<irq-number>/smp_affinity_list
```

替换以下内容:

* 将 `<irq-number>` 替换为 `/proc/interrupts` 中的中断编号。

### 在隔离的 CPU 上运行进程

```bash theme={null}
taskset -c <cpu-list> <command>
```

替换以下内容:

* 将 `<cpu-list>` 替换为逗号分隔或范围形式的 CPU 列表,例如 `6,7` 或 `4-7`。
* 将 `<command>` 替换为要执行的进程名称或路径。

更改正在运行的进程的 CPU 亲和性:

```bash theme={null}
taskset -pc <cpu-list> <pid>
```

替换以下内容:

* 将 `<pid>` 替换为要修改的进程 ID。

## **内存性能调优**

### 透明大页(THP)

透明大页(THP)可为内存密集型工作负载减少 TLB 压力。默认的 Qualcomm 内核将 THP 设置为 `madvise` 模式(由应用程序选择启用)。

```bash theme={null}
# Check current mode
cat /sys/kernel/mm/transparent_hugepage/enabled

# Enable system-wide
echo always > /sys/kernel/mm/transparent_hugepage/enabled

# Disable to reduce latency spikes from huge page allocation
echo never > /sys/kernel/mm/transparent_hugepage/enabled
```

所需的 Kconfig:

```text theme={null}
CONFIG_TRANSPARENT_HUGEPAGE=y
CONFIG_TRANSPARENT_HUGEPAGE_MADVISE=y
```

### 虚拟内存 sysfs 调节项

**表:关键的 /proc/sys/vm 调优参数**

| 参数                          | 效果                                                                    |
| --------------------------- | --------------------------------------------------------------------- |
| `vm/swappiness`             | 控制交换匿名内存与回收页面缓存的倾向。在内存受限的单板上调低(10–20)以将匿名内存保留在 RAM 中。默认值:60。          |
| `vm/dirty_ratio`            | 在进程被限流写回之前,脏页可占用内存的最大百分比。写密集型工作负载可调高(30–40)。默认值:20。                   |
| `vm/dirty_background_ratio` | 后台写回开始的百分比。默认值:10。                                                    |
| `vm/vfs_cache_pressure`     | 回收 dentry 和 inode 的倾向。调低(50)可保留文件系统元数据缓存;对内存有限的嵌入式目标可调高(200)。默认值:100。 |
| `vm/min_free_kbytes`        | 内核开始回收的水位线。对于实时延迟需求可调高,以避免 OOM 引起的延迟尖峰。                               |
| `vm/watermark_boost_factor` | 在分配压力激增后临时提高水位线。设置为 0 可禁用。默认值:15000(150%)。                            |

路径相对于 `/proc/sys/`。

### ZRAM 与 CMA

有关 ZRAM 交换配置和 CMA 区域调优,请参阅[配置与管理内存](./configure-and-manage-memory)。

## **块 I/O 调优**

### 选择 I/O 调度器

Qualcomm 平台通常使用带多队列 blk-mq 的 UFS 或 eMMC 存储。查看所有块设备的当前调度器:

```bash theme={null}
for dev in /sys/block/*/queue/scheduler; do
    echo "$dev: $(cat $dev)"
done
```

**表:按存储类型推荐的 I/O 调度器**

| 存储类型 | 调度器              | 理由                                             |
| ---- | ---------------- | ---------------------------------------------- |
| UFS  | `none`           | UFS 控制器自行处理命令排队(UFS Command Queue)。直通模式提供最低延迟。 |
| eMMC | `mq-deadline`    | 基于截止期限的排序可防止混合工作负载中的读取饥饿。                      |
| NVMe | `none` 或 `kyber` | 令牌桶延迟目标机制对 SSD 很有效。                            |

为设备设置调度器:

```bash theme={null}
echo none > /sys/block/<device>/queue/scheduler
```

替换以下内容:

* 将 `<device>` 替换为块设备名称,例如 `sda`。

### 调优预读(read-ahead)

```bash theme={null}
# Increase for sequential workloads such as firmware update or logging
echo 512 > /sys/block/<device>/queue/read_ahead_kb

# Decrease for random access workloads such as databases
echo 128 > /sys/block/<device>/queue/read_ahead_kb
```

替换以下内容:

* 将 `<device>` 替换为块设备名称,例如 `sda`。

## **Qualcomm DCVS 与 DDR 带宽**

Qualcomm 动态时钟与电压调节(DCVS)管理 L3/LLC 缓存、末级缓存控制器(LLCC)和 DDR 的频率。有两种机制驱动内存频率投票:将 CPU 频率与内存频率关联的静态 OPP 表,以及根据实测总线流量投票的 BWMON 调速器。

### 静态 CPU 到内存的映射

`qcom-cpufreq-hw` 驱动从 DTSI 中每个 CPU OPP 条目读取 `opp-peak-kBps`。当 CPU 以给定频率运行时,驱动会为相应的 L3 和 DDR 带宽投票。以下是 QCS6490 DTSI 中的示例条目:

```text theme={null}
cpu0_opp_1516mhz: opp-1516800000 {
    opp-hz       = /bits/ 64 <1516800000>;
    opp-peak-kBps = <5400000 51200000>;  /* DDR kBps, L3 kBps */
};
```

提高 `opp-peak-kBps` 值可在较低的 CPU 频率下为更高的内存频率投票,以功耗换取更低的内存延迟。驱动源码为 `drivers/cpufreq/qcom-cpufreq-hw.c`。

### BWMON 调速器

`icc-bwmon` 驱动(`drivers/soc/qcom/icc-bwmon.c`)采样 CPU 到 LLCC 和 CPU 到 DDR 的带宽计数器,并据此发出 ICC 带宽投票。在设备树中调优采样周期和阈值:

```text theme={null}
&bwmon_cpu {
    qcom,count-unit     = <0x1000>;  /* 4 KB per count */
    qcom,threshold-high = <400>;
    qcom,threshold-med  = <200>;
    qcom,threshold-low  = <50>;
    qcom,sample-ms      = <4>;       /* 4 ms sampling period */
};
```

在运行时监控活动的 ICC 带宽投票:

```bash theme={null}
cat /sys/kernel/debug/interconnect/interconnect_summary
```

有关 DVFS 调速器选择和缓存频率映射详情,请参阅[配置动态电压频率调节(DVFS)调速器](./configure-the-dynamic-voltage-and-frequency-scaling-dvfs-governors)。

## **硬件性能分析**

ARM64 Qualcomm SoC 通过 ARM PMUv3 接口暴露硬件性能计数器。`perf` 工具利用这些计数器分析 CPU 利用率、缓存未命中和内存停顿。

### 所需的 Kconfig

```text theme={null}
CONFIG_PERF_EVENTS=y
CONFIG_HW_PERF_EVENTS=y
CONFIG_ARM_PMU=y
CONFIG_QCOM_L2_PMU=y
CONFIG_QCOM_L3_PMU=y
```

### 采集系统级性能快照

```bash theme={null}
perf stat -a -e cycles,instructions,cache-misses,cache-references sleep 10
```

### 分析特定进程

```bash theme={null}
perf record -g -p <pid> -- sleep 5
perf report
```

替换以下内容:

* 将 `<pid>` 替换为要分析的进程 ID。

### Qualcomm L3 PMU 事件

Qualcomm L3 PMU 驱动以 `qcom_l3_cache/` 前缀暴露按切片(per-slice)的 L3 缓存事件:

```bash theme={null}
perf stat -e qcom_l3_cache/event=0x21/ -a sleep 5
```

### 使用 perf top 进行实时分析

```bash theme={null}
perf top -g --call-graph dwarf
```
