西门子之星的香农信息容量

摄影科学家和工程师强调,没有任何一个单一的数字能够令人满意地描述摄影系统再现拍摄对象微观特征的能力。

新闻:Imatest 23.1包含一种新的倾斜边缘图案信息容量计算方法,该方法已在白皮书《 使用 Imatest 测量相机信息容量》中开发和介绍。倾斜边缘法比西门子星形法更快更高效,但在测量去马赛克、图像压缩和饱和度造成的伪影方面效果不佳。

Imatest 2020.1(2020 年 3 月) 香农信息容量现在根据西门子星的图像进行计算。

西门子星形法在2020年电子成像大会上提出,并发表在题为“ 利用西门子星形图像测量相机香农信息容量”的论文中,该论文可在电子成像大会网站上找到链接。下文所述的白皮书更易于阅读。(另见Imatest新闻报道: 利用西门子星形图像测量相机香农信息容量。)

 

2020 年修订版白皮书《 西门子星形相机信息容量》简要介绍了信息论,描述了西门子星形相机信息容量的测量,然后展示了结果(包括伪影的影响)。

第二份白皮书(2023 年)《 使用 Imatest 测量信息容量》描述了一种利用广泛使用的倾斜边缘测量信息容量的方法。

  • 斜边法速度更快、更方便,更适合测量图像的总信息量。它适用于大多数应用,但是……
  • 西门子星形法更适合观察图像处理伪影的影响。
克劳德·香农

挑战总是令人兴奋的!电子通信信道就有一个这样的指标——它量化了信道在无误传输的情况下所能传输的最大信息量。该指标包含了清晰度(带宽)和噪声(胶片颗粒)。而相机——或者任何数字成像系统——就是这样一个信道。

该指标最早由贝尔实验室的克劳德·香农于1948年提出,现已成为电子通信行业的基础。它被称为香农信道容量或香农信息传输容量C ,其公式看似简单,实则不然。(更多详情请参阅维基百科上关于香农-哈特利定理的页面。)   

 

W  通道带宽与图像清晰度相关。  S  是信号能量(信号的平方)。  其中,电压(与图像中的MTF²成正比)和N是噪声能量(均方根噪声电压的平方),对应于胶片中的颗粒。这看起来很简单(只比E = mc²略微复杂一些),但应用起来并不容易。

克劳德·香农是一位真正的天才。《 与克劳德·香农共度一万小时:天才如何思考、工作和生活》这篇文章非常值得一读。 《纽约客》和《科学美国人》上也刊登过一些关于他的文章。我尤其对时长29分钟的视频《克劳德·香农——信息时代之父》感兴趣,这部视频由加州大学圣地亚哥分校记忆与记录研究中心制作,我以前工作时经常去那里。

我们将介绍如何从西门子星图像中计算信息容量,从而能够从同一位置计算信号和噪声。该方法对去马赛克、裁剪和数据压缩造成的伪影也很敏感,因此能够更精确地测量图像质量——优于成像行业迄今为止使用的任何方法。  技术细节在绿色(“技术专区”)框中。

香农信息容量的含义

(关于摄像机信息容量的白皮书对信息给出了简明的定义。)

在电子通信信道中,信息容量是指信道在无误传输的情况下能够传输的最大信息量,即衡量信道“质量”的指标。实际的信息量取决于编码——即信息的表示方式。虽然编码是数据压缩(图像在文件中的存储方式)不可或缺的一部分,但它与数码相机无关。重要的是以下假设:

假设:感知图像质量(假设图像处理流程经过良好调整)以及机器视觉和人工智能 (AI) 系统的性能与相机的信息容量成正比,而相机的信息容量是 MTF(清晰度)、噪声以及去马赛克、裁剪(如果存在)和数据压缩产生的伪影的函数。

我强调,这只是一个假设——用数学术语来说,就是一个猜想。它与我的经验和大量测量结果相符,但(截至2020年2月)在被业界接受之前,还需要进行更多测试(使用各种图像)。现在,信息容量可以通过Imatest方便地计算,我们有机会更深入地了解它。

正如我们所提到的,信息容量是带宽W和信噪比S/N的函数。

在介绍香农容量的文献中,带宽W通常被假定为半功率频率,它与 MTF50 密切相关。严格来说, W log 2 (1+ S / N )仅适用于白噪声(具有平坦频谱)和简单的低通滤波器 (LPF)。但数码相机具有不同程度的锐化,而强烈的锐化会导致响应曲线出现较大的峰值,从而与简单的 LPF 响应产生显著偏差。因此,我们使用香农-哈特利方程的积分形式:

正如论文《利用西门子星像测量相机香农信息容量》中所述,我们必须修改该方程以考虑像素的二维特性,方法是将其转换为二重积分,然后转换为极坐标形式,最后再转换回一维形式。相关方程如下所示(绿色方框)。

西门子星形方法的优点在于,信号功率S ( f )和噪声功率N ( f )是从同一位置计算的(具有一定角度范围和较窄半径范围的分割,其中S和N受到相同的图像处理)。

测量信息容量的关键挑战之一在于如何定义平均信号功率S。理想情况下,该定义应基于广泛使用的测试图表。为方便起见,该图表应具有比例不变性(因此无需精确测量图表放大倍数)。如前所述,信号和噪声应在同一位置进行测量。

为了确保不同观察者获得相同的结果,星图的设计和对比度应标准化。为此,我们推荐使用类似于 ISO 12233:2014/2017 附录 E 中规定的正弦西门子星图。对比度应尽可能接近 50:1(标准中规定的最小值;接近使用哑光介质所能达到的最大值)。过高的对比度会使星像难以线性化。较低的对比度是可以接受的,但应在结果中注明。对于高分辨率系统,星图应包含 144 个周期,而对于低分辨率系统,72 个周期就足够了。用于将图像居中以便分析的中心标记(象限图案)的直径应为星体直径的 1/20。

获取和构图

在均匀、无眩光的光线下拍摄西门子星的曝光良好的图像。测试多台相机时,曝光应基本一致。星体内部线性化图像的平均像素值应在 0.16 到 0.36 之间。(最佳值尚未确定。)

为最大程度地减少光学畸变(如有)造成的测量误差,星形中心应靠近图像中心。为确保自动居中功能正常工作,图像方向应使中心区域的边缘接近垂直和水平。

图像中星形图案的大小应设置成:对应于最小半径r<sub> min </sub> 的最大空间频率大于奈奎斯特频率f <sub>Nyq</sub> ,并且尽可能不大于 1.3 f <sub>Nyq</sub> ,以便有足够的低频可用于信道容量计算。这意味着,一个 144 周期、内标记半径为 1/20 的星形图案的直径应为 1400-1750 像素,而一个 72 周期的星形图案的直径应为 700-875 像素。对于高质量喷墨打印机,星形图案的物理直径应至少为 9 英寸(最好为 12 英寸,即 23 至 30 厘米)。

星图周围可能还有其他景物,但平均背景应接近中性灰(反射率 18%),以确保良好的曝光(必要时可以进行曝光补偿)。右图显示的是一台 2400 万像素(4000×6000 像素)相机拍摄的典型星图。

运行Star模块

从目标中选择Star ,可以在交互模式下(推荐用于入门)或在自动(批处理)模式下批量处理文件。

在星图设置窗口中,确保选中“计算信息容量”复选框(位于“设置”部分底部附近) 。SNRI设置将在稍后介绍。如果其他设置正确,请按“确定”。

星设置窗口

按下“确定”按钮后,系统将分析图像。Rescharts 中可以选择多种显示方式。下表列出了仅可用于信息容量测量的显示方式。

用于信息容量测量的显示器
主显示屏副显示屏描述
9. 信息能力,SNRI信噪比平均片段和最多 8 个独立片段的信噪比 (S/N) 与空间频率的关系
信噪比(dB)平均段的信噪比(dB)与频率的关系等。
信号、噪声平均段的信号、噪声和 (S+N)/N (dB) 作为频率的函数。
信号,10倍噪声信号、10倍噪声以及(S+N)/N (dB)作为平均片段频率的函数。可用于可视化低噪声水平。
东北噪声等效量子随频率的变化
10. 差分图像(仅噪声等)仅噪声(输入无噪声)仅显示噪声(已去除信号)。这是一个非凡的结果——可能是首次在存在信号的情况下测量和可视化噪声。
损失(输入-理想)输入——无损(测试图表图像)。显示的数据已被衰减,难以解读。
输入图像输入图像(未修改)
无噪声图像理想(无噪声)输入图像(有 MTF 损失),由S ideal导出。
理想图像(无MTF损失)无MTF 损失的“理想”图像(代表原始测试图)。
仅噪声(线性)仅进行噪声线性化处理。通常比伽马编码版本更暗。
输入图像(线性)输入图像已线性化。通常比伽马编码版本更暗。
11. 三维曲面图以三维曲面图的形式显示信号随角度(图表上)和空间频率(以周期/像素为单位)的变化。最多显示 8 个图表周期(显示更多周期会使画面杂乱且难以解读)。图像可以旋转。请注意,图表中实际的矩形(角度× 频率)显示区域呈扇形。此外,还显示了信号和噪声随频率变化的小图以及结果摘要。

结果

Rescharts 的三个显示界面专门用于显示信息容量结果: 9. 信息容量、信噪比 (SNRI) 、 10. 输入无噪声差分等,以及11. 3D 曲面图。以下是使用 Rescharts 运行 Star 程序,对一张原始图像(使用 dcraw 程序,采用 24 位 sRGB 预设转换为 TIFF 格式;伽马值约为 2.2)进行分析的结果,该图像由一台高质量的 2400 万像素微型四分之三系统相机拍摄。

信息容量图

下图显示了 2400 万像素微型四分之三索尼 A6000 在 ISO 400 下的信号、噪声和(信号+噪声)/噪声(dB)。

来自a的信号、噪声和香农信息容量(3.21比特/像素)
来自高质量 2400 万像素微型四分之三系统相机的原始图像(转换为 TIFF 格式),ISO 400。

这显示的是同一幅图像在相机内直接转换为JPEG格式后的结果。曲线上有一个“凸起”,这是锐化处理的特征。请注意,即使JPEG图像经过锐化处理,其香农信息容量仍然低于原始图像。

这是因为高频噪声和信号一起被放大了。

信号、噪声和香农信息容量
(2.92 位/像素)
来自相机内JPEG
图像
高品质 2400 万像素
微型四分之三系统相机,ISO 400。

差异图像图(输入无噪声等)

仅噪声图(输入图像与无噪声图像之差)尤为重要,因为此前尚无图像能够测量和可视化在信号存在下(去除正弦星形图案)的噪声。由于在 ISO 400 下噪声极低,难以观察,因此我们以 ISO 25600(微型四分之三系统相机的最高感光度)为例,分别展示了原始 TIFF 格式和 JPEG 格式图像的噪声情况。右侧的“复制图像”按钮可将图像复制到剪贴板,您可以将其粘贴到图像编辑器/查看器或图像统计模块中进行进一步分析。

适用于微型四分之三系统相机的无噪图像,raw/TIFF 图像,ISO 25600。

右侧图像是使用同一相机拍摄的同一张照片(ISO 25600)的相机内JPEG格式图像。它与原始/TIFF图像看起来非常不同,因为进行了降噪处理。

下面的图片是同一台相机在 ISO 400 下拍摄的原始/TIFF 图像和相机内 JPEG 图像。

相机内JPEG格式,ISO 25600
raw/TIFF ISO 400
相机内JPEG格式,ISO 400

三维曲面图

3D 表面图允许您详细检查图像的小部分。

上文分析的高品质 2400 万像素微型四分之三相机的 3D 表面图。

要获得此显示效果,必须在设置窗口中启用“3D 曲面图计算” (以及“计算信息容量”)。它会将信号(针对所选通道)显示为角度和空间频率(单位为周期/像素)的函数,其中空间频率与半径成反比。此图表示原始图像的一个狭窄扇形区域,其中高空间频率处的角度细节被显著放大。

图中显示了 MTF 和噪声随空间频率变化的小图,以及关键结果(信息容量等)的摘要。

绘制此图的动机源于在 iPhone 10 上的测试。测试中,图像在中低空间频率范围内似乎出现了饱和现象,但仅凭图像本身难以评估饱和程度。正如我们在右侧所见,饱和度非常高,这显然是某种局部色调映射的结果。在星形图案或相邻倾斜边缘的 MTF 曲线中,这种饱和现象并不明显。iPhone 上安装了一些 Adobe 软件,可以同时拍摄 RAW (DNG) 和 JPEG 格式的图像。我们尚不清楚这是否会影响 JPEG 处理。

下图显示了 TIFF 文件(由同一台 iPhone 10 拍摄的 DNG 原始图像转换而来)的响应。响应呈正弦波形——表现良好,没有明显的振幅失真。信息容量几乎与失真的 JPEG 图像相同,其中存在以下几个问题:图像饱和时随机噪声为零,但噪声的定义见下文。 (如下)由于振幅失真(偏离正弦函数)而增大。

在其他案例中观察到的信息容量对图像处理不敏感,这是一个显著的结果。相比之下,经过高度处理的JPEG图像的MTF50和MTF50P值要高得多。

从 iPhone 10 TIFF 格式的原始 (DNG) 文件生成 3D 曲面图
正面视图,显示出良好的正弦图案。

从 iPhone 10 JPEG 图像生成的 3D 曲面图
正面视图,显示明显的裁剪痕迹
(与预期正弦波的偏差)。

从 iPhone 10 JPEG 图像生成的 3D 曲面图
旋转(后视图),显示响应滚降。
绿色部分是给数学极客的。你会被精彩的方程式所吸引吗?你曾经对大学数学课充满热情吗?那么你很可能就是一位数学极客——一个不被理解但却极其精英的群体。绿色文字是为你准备的。如果你只是普通人或者数学不太好,你可以跳过这些部分。你永远不会知道自己错过了什么。

利用西门子星形图像计算香农容量

大多数可互换图像(通常采用 sRGB 或 Adobe RGB 等色彩空间编码)的像素级别都经过伽马编码。对于这些文件,像素级别 ≅ (传感器亮度) 1/伽马,其中伽马值(通常约为 2.2)是该色彩空间的预期显示伽马值(显示亮度 = (像素级别)伽马)。要分析这些文件,必须通过将像素级别提升至伽马次方来对其进行线性化。RAW 文件通常不需要线性化(如果它们在去马赛克处理时没有进行伽马编码,即伽马 = 1)。

n总周期西门子星的图像被分成n r = 32 或 64 个径向段和n s = 8(推荐)、16 或 24 个角度段。每个段的周期(以弧度为单位的角长度) P = 2 π n total /n s ,包含n k = n total / n s个周期和k n个信号点,每个信号点位于已知的角度位置φ ,范围为{0, P } 。

我们假设该段中的理想信号具有以下形式

a和b是使用傅里叶级数系数方程计算的,这些方程源自维基百科傅里叶级数页面,方程 1。

其中S ( φ )是该段的测量信号(实际上是信号加噪声)。[注意,虽然此公式不在 ISO 12233:2017 标准中,但它完全符合附录 F 第 5 步的要求(“通过最小化平方误差,将具有预期频率的正弦曲线拟合到测量值。”)]

噪音是

以半径r (以像素为单位)为中心的线段的频率f (以周期/像素为单位)为这个方程的一个有趣推论是,很容易找到奈奎斯特频率(0.5 C/P) : = 45.8 像素, n总计= 144 个周期。

如果由于中心误差、光学畸变或其他因素导致f与预期值略有不同,则需要进行小的调整(此处未描述)。

信号功率是噪声功率是其中σ²为方差(标准差的平方)。注意,信号加噪声功率为[注:根据香农的论述“噪声环境下的通信”,我们假设N ( f ) 是在理想信号 S ( f ) 存在的情况下测得的噪声;而不是频率为f的窄带噪声。]

将香农方程从一维转换为像素

香农信息论第二篇论文[1]中给出了香农容量的完整一维方程,即式(32)。由于所考虑的像素是二维的,因此不能直接使用该方程。

[一维;未使用]

由于像素(此处)的单位是面积,因此必须将此方程转换为二维方程。( 像素的单位是距离,或者像MTF这样的线性测量单位。)

其中f x和f y分别是x方向和y方向的频率。为了计算该积分,我们将x和y转换为极坐标r和θ 。

由于S和N对θ的依赖性很弱,我们可以将此方程改写为一维方程。

非常技术性:香农容量的极限情况。假设你有一个 8 位像素。这对应于 256 个级别(0-255)。如果你把级别之间的距离 1 视为“噪声”,那么香农方程的信噪比部分为log₂ (1+ 256² ) ≅ 16。信息能够正确传输的最大带宽W——奈奎斯特频率——是每个像素 0.5 个周期。(所有高于奈奎斯特频率的信号能量都是垃圾——可以说是虚假信息。)所以C = W log₂ (1+( S/N ) ² ) = 每个像素 8 位,这就是我们最初的起点。有时候,绕圈子也挺让人安心的。

概括

  • 香农信息容量C长期以来一直被用作衡量电子通信信道质量的指标。它规定了在采用适当编码的情况下,数据传输无误的最大速率(人们花了近半个世纪才找到接近香农容量的编码)。对于成像而言,编码并非关键所在。
  • C通常以每像素比特数来衡量。总容量为。
  • 在计算C之前,必须对通道进行线性化,即必须应用适当的伽马校正(信号 = 像素级伽马,其中伽马值约为 2)以获得正确的S和N值。伽马值(接近 2)可通过运行任何分析灰阶阶梯图的Imatest模块来确定,例如:阶梯图、颜色检查、固定或交互式颜色/色调、 SFRplus或eSFR ISO 。
  • 我们假设C值可以作为评价相机质量的指标,尤其适用于机器视觉和人工智能相机。(它不能直接应用于消费级相机,因为消费级相机需要精心调校才能发挥其潜力,即拍摄出令人满意的图像。)它为比较相机提供了一个公平的基准,尤其是在使用经过最少处理的RAW格式图像时。
  • Imatest计算数字图像Y(亮度)通道的香农容量C ,该容量近似于人眼的敏感度。它还计算各个 R、G 和 B 通道以及色度通道 C <sub>b </sub> 和 C <sub>r </sub> 的C 值(由 YC<sub> b </sub>C<sub> r </sub> 得出)。
  • 香农容量过去一直未被用于表征摄影图像,因为其计算和解释较为困难。但如今,香农容量的计算变得简单,其与摄影图像质量的关系也值得进一步研究。
  • 我们期待与能够验证C 语言与机器视觉/人工智能系统性能(准确率、速度和功耗)之间相关性的公司或学术机构合作。

整幅图像的信息容量

我们目前讨论的信息容量是针对单个恒星的,通常位于图像的中心附近。

确定单个像素的信息容量之后,下一步是计算相机的总信息容量C <sub>total</sub> 。遗憾的是,由于镜头锐度( MTF响应)往往不均匀,通常会随着与图像中心距离的增加而降低,因此无法通过简单地将C乘以像素数来可靠地获得总信息容量。要获得图像的总信息容量,有两种方法。

  1. 使用西门子星图网格,类似于 ISO 2014/2017 标准中所示的网格。但这种方法不太方便,因为 Imatest 无法自动检测星图网格,而且如果存在严重的光学畸变,这种方法的效果会很差。


  2. 使用具有多个斜边的视力表,最好是带有自动感兴趣区域 (ROI) 检测功能的Imatest视力表。推荐使用eSFR ISO 、 SFRplus或Checkerboard 型号,但任何斜边模块均可使用。这需要拍摄第二张图像。

斜边法——我们推荐“ 使用 Imatest 测量信息容量”中描述的新(2023 年)方法。

信息容量噪声计算设置,
从 Rescharts 设置窗口的截图中截取
信息容量噪声计算设置,
从“更多设置”窗口的左侧

完整的窗口和完整的说明在SFRplus 、 eSFR ISO 、 Checkerboard 、 SFRreg或SFR中。

结果以 Edge/MTF 图、两个新的 3D 图以及 JSON 输出的形式呈现。示例请参见白皮书。

选择“3D 和等高线图”以及“边缘信息上限 C_Max” 。这将显示C_max 、 C_max_slant_mean和C_max_slant_total的平均值和总值。然后,

其中C max_slant_total = mean( C max_slant ) × 百万像素。

已弃用从倾斜边缘推导C总和的旧方法。

参考

  1. C.E. Shannon, “噪声环境下的通信”, 《IRE 会刊》 ,第 37 卷,第 1 期,第 10-21 页,1949 年 1 月, doi:10.1109/jrproc.1949.232969 。