论文部分内容阅读
纵观近两年的3D显示卡市场,无论是AMD还是NVIDIA的产品动作相对于前些年而言,都变得缓慢了不少。新显卡推出的速度明显见慢,这里所谓的新产品指的是核心、架构上有重大改变的产品,而不是经过一些小小的修改而推出的所谓“新品”。虽然看起来这两年显卡新品数量并不算太少,但实际上大多数是改进自之前的产品,或是将之前的产品重新定位、命名(比如新的常青树GeForce GTX250)后的产品。
这种现象实际上主要是由应用模式决定的——在3D应用需求大环境变化不大的情况下,盲目的推出新产品不见得会占到什么便宜,不如更新一些更符合当前应用需求的产品,这些产品更易被用户接受。毫无疑问,3D显示卡对于普通民用级电脑来说,其主要作用是运行3D游戏。而最近一段时间,3D游戏对性能的需求并未有太大突破。从近期发售的一些3D游戏不难看出这一点来。
首先,对于网络游戏而言,为了能够让绝大多数用户的电脑都能流畅的运行,以便获取最大数量的在线用户,网络游戏通常并不需要特别强悍的显卡来支持,即便是《魔兽世界》,一般的显卡也能比较轻松的跑下来。其次,就单机游戏而言,目前大多数游戏公司,比如EA、UBi,甚至是日本的Capcom,开发的游戏都是多平台、全机种同时支持。那么为了照顾性能相对较低的Console Gaine平台,比如Xbox 360或是PS3,其游戏的3D特效就不可能做的特别夸张,否则Console Gaine平台将很难流畅的运行这些游戏,这对于Console Game玩家而言是不可接受的。由此,当这些跨平台的单机游戏出现在PC上时,往往仅仅是分辨率更高,支持更高倍的抗锯齿,或者是仅仅增加小部分3D特效。这就让这些游戏对显卡的需求也不会很高。而传统的FPS射击类游戏,近年来也并未出现疯狂消耗3D显卡性能的全新3D引擎。
基于这种情况,有必要推出新的3D显示核心吗?不如继续完善当前核心,推出一些针对视频应用的功能和技术,吸引不太玩3D游戏的用户购买适当的3D显示卡产品来的划算。但是Direct X11已经出现,再固守在之前的产品上,恐怕就要失去未来的市场。所以推出新产品势在必行。目前AMD在这方面已经领先一步推出了新产品,而NVIDIA也随后推出了采用Fermi(GF100)核心架构的新产品GeForce GTX480和GeForce GTX470。
Fermi猜想
早在2009年,NVIDIA就对外宣布了Fermi的存在,一时间各种预测遍布互联网。可见用户对于NVIDIA的新产品充满了好奇。当时大家普遍认为Fermi应该叫“GT300”,因为之前的一代核心也就是我们熟悉的GeForce GTX 285系列产品的核心编号为GT200。而当Fermi正式出现在我们面前的时候,却使用了一个让我们颇感意外的“GF100”。那么,从GT到GF,究竟有什么样的改变呢?

首先,Fermi的架构源自之前的GT200,也就是Tesla;而GT200则起源于更早的G80核心。这主要是指在统一渲染架构体系这一点而言,但Fermi不应该,也不可能完全与之前的产品相同,仅靠在旧有架构上增加Stream Processor数量来换取性能提升。这种做法会直接导致晶体管数量的几何级增长,随之而来问题还有温度、功耗、芯片面积等问题。对于Fermi而言,其内部渲染核心,也就是我们比较熟悉的Stream Processor,正式更名为CUDA Core,并且在整体架构设计方面有了较大的变化,但统一渲染架构的基本思路并未改变。而且CUDA架构原本就支持异构计算模式,而Stream Processor不足以让用户认识到这一点,而CUDA Core则更强调GeForce显示核心出色的异构计算能力,改名也就算是顺理成章。
我们知道,GT200系列最强悍的单芯片GPU GeForce GTX285的CUDA Core数量为240个;而Fermi的CUDA Core数量为512个。在这种情况下,即便不做其他改动,仅靠CUDA Core数量的增长,也会获得至少2倍于GeForce GTX285的性能提升。之前GT200核心架构中,支持10组被称之为Texture Processing Clusters(材质处理集群,TPC)的处理区块,每一组TPC具有三组Streaming Multiprocessors(流式多路处理单元,SM),这些Streaming Multiprocessors内部包含8个SP及8个材质处理单元。而现在这个架构进一步进化成设计的更为精巧的资源整合型结构——Fermi将所有这些资源,整合成4个功能区块——这就是Fermi的核心架构Graphic ProcessorClusters(图形处理集群,GPC)。
这些被称之为GPC的运算集群取代了之前的TPC,并且将之前在独立于TPC之外的功能模块整合进Fermi的GPC运算集群中来。Fermi的GPC运算集群包括升级到4组SM的GPC光栅引擎,每一组SM包括32个CUDA Core,同时集成4组专用材质单元,这些材质单元支持双路动态线程调度技术,并且具备64K B独立可编程共享缓存。从数量上来看,GT200的材质单元要比Fermi更多,GT200每一组TPC中包含8个材质单元,而一颗GPU中则有10组TPC;而Fermi核心每一组SM配备4个材质单元,总计64个材质单元。但由于Fermi的每个材质单元没每个时钟周期内可以完成一个材质运算,并获取4个材质样本,所以从实际性能上来看,Fermi架构实际上是要优于之前的GT200的。
Fermi的线程调度则由全新的GigaThread引擎完成,负责给Fermi的16组SM分配渲染任务。GigaThread是Fermi架构的重要核心部分,这套引擎可以并行创建并指派线程,较之之前的单线程轮询过程要更为高效。当然,GigaThread引擎同样要从显存中获取数据,所以乍看上去Fermi的6组64bit,总计384bit的显存位宽,好像要比GT200的8组64bit,总计512bit显存位宽来得差一些。然而,NVIDIA这次给Fermi配备的是GDDR5显存,GDDR5的带宽本身就要比GDDR3更高,因此实际上Fermi并不需要过多的显存控制器,也能获取较高的显存带宽。

在Fermi架构中,处于最末端的是6组ROP(Raster Operater Unit,光栅处理单元),这些ROP在同时输出8个32bn整数型像素。相对而言,之前的GT200的8组ROP在单个时钟周期内只能输出4个整数型像素。虽然Fermi仍然保持单周期64bit内存 控制器模式,但将每周期输出32个整数型像素提升到了每周期输出48个整数型像素。因而,Fermi可以支持一种全新的全屏抗锯齿模式——32x CSAA模式。并且,在32xCSAA模式下,只比8x MSAA模式损失约10%的性能。
总体来说,Fermi在之前的统一渲染架构基础上,进行了大刀阔斧的改进,其主要目的自然是为了实现更真实的3D特效,新架构在几何运算方面较之之前的产品更有优势,几何运算能力则直接影响到3D建模的精细度和性能,而这正是“精确真实的世界”的基础。同时,新架构对CUDA异构计算更为有利,执行效率较之前代产品有不小的提升,此外针对这一架构进行异构计算的程序开发也会更为简便。
缩水的Fermi
之所以将这两款GeForce GTX产品放在一起来谈,主要是因为GeForce GTX480和GeForce GTX470是基于Fermi架构的第一代产品,其核心架构基本一致,所支持的特效和产品特性也基本相同。不同之处在于为了能够实现性能上的差异,GeForce GTX470比GeForce GTX480在核心内部减了一些Stream Multiprocessor,从而使得GeForce GTX470的性能略低于GeForce GTX480。然而,事实上就算是GeForce GTX480的规格也并非与之前我们讨论的Fermi完全相同,GeForce GTX480同样在核心架构上做了一定的简化。换句话说,NVIDIA显然在Fermi这个平台上留了后手,这应该是为了应付不久之后必然出现AMD反扑做准备。这在之前的几轮的3D显示核心竞争中已经是一种常态了。

那么GeForce GTX480和GeForce GTX470做了哪些简化呢?最直观的就是GeForce GTX480和GeForce GTX470的CUDA Core数量并不是Fermi标准的512个。512个CUDA Core被分成4组GPC,每组GPC包含4组SM单元,每组SM单元包含32个CUDA Core。而GeForce GTX480相对于Fermi而言,减少了32个CUDA Core,其核心数量为480个CUDA Core;至于GeForceGTX470则在GeForce GTX480的基础上再减少32个CUDA Core,其CUDA Core的数量为448个。这样一来,相当于GeForce GTX480比Fermi少了一组SM单元,而GeForce GTX470少了两组SM单元。
由于在Fermi的SM处理单元里还集成了独立的材质单元和多边形引擎(该引擎直接影响到芯片的几何性能),因此GeForce GTX480和GeForce GTX470在材质和几何运算方面性能也有所下降。GeForce GTX480拥有60个材质单元及15个多边形引擎;而GeForce GTX470则仅有56个材质单元和14个多边形引擎。由于Fermi的ROP是独立在GP C架构外的,因此即便是简化版的GeForce GTX480也拥有全部的ROP引擎,每一个ROP均具备单周期输出8个32bit整数型像素数据的能力,全部ROP可以单周期输出48个像素数据。而GeForce GTX470就没有这么幸运了,GeForce GTX470减少了一组ReP,因此其单周期像素数据输出为40个32bit整数型像素数据。
完整的Fermi支持384bit GDDR5显存位宽,每个内存控制器提供64bit显存位宽。因此GeForce GTX480同样支持384bit GDDR5显存,每个控制器可以控制256MB显存,因此GeForoe GTX480最大可支持1.5GBGDDR5显存,在924MHz显存频率下,其显存带宽为177GBps。而GeForce GTX470则仅能支持320bit显存位宽,最大支持1.25GBGDDR5显存,并且显存频率也要略低一下,其显存频率为837MHz,因而GeForce GTX470的显存带宽为134GBps。
经过简化后的Fermi,在性能上与最初设计的规格相比,恐怕会有一些下降。不过考虑到这些产品是在AMD的RadeonHD5870和Radeon HD5850之后推出的,NVIDIA没有理由让自己的最新旗舰级产品的性能低于竞争对手的产品,因此可以预见的是这两款产品的性能应该会高于AMD的两款产品。但恐怕这两款产品的性能无法达到预期的GeForce GTX285性能的两倍了。
GeForce GTX480和GTX470
我们手头的GeForce GTX480和GeForce GTX470均为华硕送来的工程样品,两款产品均采用NVIDIA官方的公版设计。GeForce GTX480的PCB板尺寸为10.5英寸,需要1根8pin和1根6pin独立供电电源才能稳定工作.其设计功耗为250W。虽然其峰值功耗算不上太夸张,但我们仍然建议用户使用600W电源来搭配GeForce GTX480使用。同时,由于显卡满负荷工作时的稳定较高,因此GeForce GTX480配备了一套十分夸张的散热系统,这套散热系统由5条内循环热管和一组体积十分庞大的铝质切割工艺鳍片组成,以确保显卡可以稳定的工作。
相对而言,GeForce GTX470就要小巧一些,GeForce GTX470的PCB板尺寸为9.5英寸,需要2跟6pin独立供电来弥补PCI-E插槽供电不足的问题。相对而言,GeForce GTX470的功耗要小一些,其设计的峰值功耗为200W,500W的电源也能够让GeForce GTX470稳定的运行。同时,由于功耗相对较低。GeForce GTX470的散热器也不想GeForce GTX480那么夸张,只是普通的OTES散热器,并没有配备热管。

至于两款产品的规格其实在之前的文章中已经讨论过了,这里附上一个详细的规格配置表供读者对比使用。总体来说,这两款产品的基本硬件配置并没有太出人意料的地方,算得上是中规中矩吧,不过GeForce GTX480那庞大而沉重的散热装置着实比较吓人,安装在机箱内最好做好固定工作,否则无论是出于其他配件安全考虑,还是GeForce GTX480自己的PCB强度,都会受到严峻的考验。
新功能
其实从严格意义上来说,GeForce GTX470和GeForce GTX480支持的特性也不能算是完全的新特性。比如说,GeForce GTX470和GeForce GTX480支持DirectX11、支持光线追踪技术、支持SLi、支持PhysX技术、支持PureVideo HD技术,除了DirectX 11,其他都不能算作是新技术、 新功能了。另外,它们还支持32x CSAA全屏抗锯齿和Surround技术,这两项技术中,32x CSAA全屏抗锯齿技术之前的产品从性能上就无法实现,而GeForce GTX470和GeForce GTX480的性能足够强悍,因此可以支持;而Surround技术则是一套环幕多显示器输出技术,显然是针对竞争对手的类似技术而推出的。
真正值得一提的恐怕只有对DirectX 11的支持了。DirectX 11的一个重大变化是将Tessellation功能作为DirectX 11的标准功能,而不再是某一厂商的特色技术。这就意味着未来会有越来越多的游戏针对Tessellation进行设计。Tesselation(细分曲面技术),实际上是由AMD研发的一项技术,该技术可以利用GPU在几何构成阶段,不断细化模型表面,从而创建出更为精密的模型。而对于设计人员来说,则不需要进行复杂的建模过程,只要按照正常模式建模,其他工作可由支持该技术的GPU完成。
不过由于该技术会消耗掉大量的显卡资源,因此只有在一些特殊情况下才会使用,比如镜头视角距离目标物体很近的情况,使用Tessellation可以让画面的质感大为提升。而大多数情况下,并不一定需要Tessellation功能。现在,既然Tesseliation已经成为DirectX 11的标准功能,那么NVIDIA也必须支持该功能才行。也正是因为如此,NVIDIA才在Fermi上启用了全新的并行架构,以便获取更好的Tessellation性能。从NVIDIA放出的演示Demo来看,Fermi做的还是相当不错的。
另外一项值得我们注意的技术就是全新的32x CSAA全屏抗锯齿技术了,正如前面所说的,这相技术完全得益于Fermi的全新设计和超强的性能,可以在不损失太多性能的情况下,实现更好的显示效果。此外,由于GeForce GTX470和GeForce GTX480的性能足够强劲,可以最高支持2560×1600的超高分辨率,因此实现Surround环绕多屏输出也就是顺理成章的事情了。而基于CUDA Core的并行异构计算能力,使用GeForce GTX470和GeFore GTX480来从事一些运算强度大的科学计算是相当不错的选择。而一如既往强悍的PureVideo HD可以让GeForce GTX470和GeForce GTX480轻松的实现高清视频的硬解码加速功能,但是对于HTPC用户来说GeFome GTX470和GeForce GTX480可不是合适的选择。
性能测试
作为NVIDIA最新一代的旗舰级产品,这两款显卡的性能毫无疑问是顶级的,因此实际上大家所关心的并不是“它们到底强不强?”,而是“它们到底有多强?”。而我们的测试则是对种种疑问最好的证明。关于这两款显卡的测试,我们使用了相对简单的脚本,这是因为对于顶级显卡来说,测试更多的项目依然是只能证明它们很强大,它们可以在更高的分辨率下,打开更多的特效,而且还能流畅的运行最消耗显卡资源的3D游戏。而且由于目前基本上没有什么针对DirectX 11设计的3D游戏,所以过于复杂的测试意义不大,只要能体现出GeForce GTX480和GeForce 470的强大即可。
为了能够体现出这两款显卡的性能优势,我们特别选择了一款GeForce GTX285作为对比测试平台。测试项目比较传统,包括3DMark Vantage、StreetFighter 4、H.A.W.X,以及著名的FarCry 2。除去标准测试3DMarkVantage外,其他三项游戏测试项目对CPU性能的要求都不高,刚好可以完整体现出被测显卡的性能。测试设置方面,对于3DMark Vantage,我们使用的是最高画质测试;对于游戏项目,则是开启了8×抗锯齿、8×各异向过滤,同时打开游戏可支持的最高分辨率,并设置成特效全开模式进行测试。
从测试成绩来看,GeForce GTX480和GeForce GTX470的性能十分了得,与之前的一代产品相比,性能提升显著。这就不免让人开始期待完整版本的Fermi了,毕竟这两款产品在架构上进行了一定程度的简化,性能表现并不能与完整版的Fermi相比。截止到本文发稿之日,名为GeForce GTX490的单卡双芯片架构产品已经确定将于2010年秋季发布。不过从单卡双芯片这种架构来看,GeForce GTX490搭载的两颗Fermi架构核心,应该也不是完整版的512颗CUDA Core核心产品,甚至其单颗芯片有可能比GeForce GTX480的CUDA Core数量还要少。到底何时才能见到最强的完整版Fermi呢?
不过对于大众用户来说,与其关注512Core的旗舰级产品,不如关心一下主流产品,或者是中低端产品。因为旗舰级的产品并不是大众用户所能接受的,而且想要配备旗舰级的显卡,在其他配件方面必然不能随便搭配。而价格更低廉的主流产品和面向入门级用户的产品,除了价格便宜且支持最新的功能外,还有一个重要因素,那就是适应能力要比高端旗舰级产品更好。至少旗舰级的产品是不会出现在用户的HTPC中,而入门级的产品往往会以视频解码作为卖点,同时这些产品应付一般游戏也完全没有问题。
这种现象实际上主要是由应用模式决定的——在3D应用需求大环境变化不大的情况下,盲目的推出新产品不见得会占到什么便宜,不如更新一些更符合当前应用需求的产品,这些产品更易被用户接受。毫无疑问,3D显示卡对于普通民用级电脑来说,其主要作用是运行3D游戏。而最近一段时间,3D游戏对性能的需求并未有太大突破。从近期发售的一些3D游戏不难看出这一点来。
首先,对于网络游戏而言,为了能够让绝大多数用户的电脑都能流畅的运行,以便获取最大数量的在线用户,网络游戏通常并不需要特别强悍的显卡来支持,即便是《魔兽世界》,一般的显卡也能比较轻松的跑下来。其次,就单机游戏而言,目前大多数游戏公司,比如EA、UBi,甚至是日本的Capcom,开发的游戏都是多平台、全机种同时支持。那么为了照顾性能相对较低的Console Gaine平台,比如Xbox 360或是PS3,其游戏的3D特效就不可能做的特别夸张,否则Console Gaine平台将很难流畅的运行这些游戏,这对于Console Game玩家而言是不可接受的。由此,当这些跨平台的单机游戏出现在PC上时,往往仅仅是分辨率更高,支持更高倍的抗锯齿,或者是仅仅增加小部分3D特效。这就让这些游戏对显卡的需求也不会很高。而传统的FPS射击类游戏,近年来也并未出现疯狂消耗3D显卡性能的全新3D引擎。
基于这种情况,有必要推出新的3D显示核心吗?不如继续完善当前核心,推出一些针对视频应用的功能和技术,吸引不太玩3D游戏的用户购买适当的3D显示卡产品来的划算。但是Direct X11已经出现,再固守在之前的产品上,恐怕就要失去未来的市场。所以推出新产品势在必行。目前AMD在这方面已经领先一步推出了新产品,而NVIDIA也随后推出了采用Fermi(GF100)核心架构的新产品GeForce GTX480和GeForce GTX470。
Fermi猜想
早在2009年,NVIDIA就对外宣布了Fermi的存在,一时间各种预测遍布互联网。可见用户对于NVIDIA的新产品充满了好奇。当时大家普遍认为Fermi应该叫“GT300”,因为之前的一代核心也就是我们熟悉的GeForce GTX 285系列产品的核心编号为GT200。而当Fermi正式出现在我们面前的时候,却使用了一个让我们颇感意外的“GF100”。那么,从GT到GF,究竟有什么样的改变呢?

首先,Fermi的架构源自之前的GT200,也就是Tesla;而GT200则起源于更早的G80核心。这主要是指在统一渲染架构体系这一点而言,但Fermi不应该,也不可能完全与之前的产品相同,仅靠在旧有架构上增加Stream Processor数量来换取性能提升。这种做法会直接导致晶体管数量的几何级增长,随之而来问题还有温度、功耗、芯片面积等问题。对于Fermi而言,其内部渲染核心,也就是我们比较熟悉的Stream Processor,正式更名为CUDA Core,并且在整体架构设计方面有了较大的变化,但统一渲染架构的基本思路并未改变。而且CUDA架构原本就支持异构计算模式,而Stream Processor不足以让用户认识到这一点,而CUDA Core则更强调GeForce显示核心出色的异构计算能力,改名也就算是顺理成章。
我们知道,GT200系列最强悍的单芯片GPU GeForce GTX285的CUDA Core数量为240个;而Fermi的CUDA Core数量为512个。在这种情况下,即便不做其他改动,仅靠CUDA Core数量的增长,也会获得至少2倍于GeForce GTX285的性能提升。之前GT200核心架构中,支持10组被称之为Texture Processing Clusters(材质处理集群,TPC)的处理区块,每一组TPC具有三组Streaming Multiprocessors(流式多路处理单元,SM),这些Streaming Multiprocessors内部包含8个SP及8个材质处理单元。而现在这个架构进一步进化成设计的更为精巧的资源整合型结构——Fermi将所有这些资源,整合成4个功能区块——这就是Fermi的核心架构Graphic ProcessorClusters(图形处理集群,GPC)。
这些被称之为GPC的运算集群取代了之前的TPC,并且将之前在独立于TPC之外的功能模块整合进Fermi的GPC运算集群中来。Fermi的GPC运算集群包括升级到4组SM的GPC光栅引擎,每一组SM包括32个CUDA Core,同时集成4组专用材质单元,这些材质单元支持双路动态线程调度技术,并且具备64K B独立可编程共享缓存。从数量上来看,GT200的材质单元要比Fermi更多,GT200每一组TPC中包含8个材质单元,而一颗GPU中则有10组TPC;而Fermi核心每一组SM配备4个材质单元,总计64个材质单元。但由于Fermi的每个材质单元没每个时钟周期内可以完成一个材质运算,并获取4个材质样本,所以从实际性能上来看,Fermi架构实际上是要优于之前的GT200的。
Fermi的线程调度则由全新的GigaThread引擎完成,负责给Fermi的16组SM分配渲染任务。GigaThread是Fermi架构的重要核心部分,这套引擎可以并行创建并指派线程,较之之前的单线程轮询过程要更为高效。当然,GigaThread引擎同样要从显存中获取数据,所以乍看上去Fermi的6组64bit,总计384bit的显存位宽,好像要比GT200的8组64bit,总计512bit显存位宽来得差一些。然而,NVIDIA这次给Fermi配备的是GDDR5显存,GDDR5的带宽本身就要比GDDR3更高,因此实际上Fermi并不需要过多的显存控制器,也能获取较高的显存带宽。

在Fermi架构中,处于最末端的是6组ROP(Raster Operater Unit,光栅处理单元),这些ROP在同时输出8个32bn整数型像素。相对而言,之前的GT200的8组ROP在单个时钟周期内只能输出4个整数型像素。虽然Fermi仍然保持单周期64bit内存 控制器模式,但将每周期输出32个整数型像素提升到了每周期输出48个整数型像素。因而,Fermi可以支持一种全新的全屏抗锯齿模式——32x CSAA模式。并且,在32xCSAA模式下,只比8x MSAA模式损失约10%的性能。
总体来说,Fermi在之前的统一渲染架构基础上,进行了大刀阔斧的改进,其主要目的自然是为了实现更真实的3D特效,新架构在几何运算方面较之之前的产品更有优势,几何运算能力则直接影响到3D建模的精细度和性能,而这正是“精确真实的世界”的基础。同时,新架构对CUDA异构计算更为有利,执行效率较之前代产品有不小的提升,此外针对这一架构进行异构计算的程序开发也会更为简便。
缩水的Fermi
之所以将这两款GeForce GTX产品放在一起来谈,主要是因为GeForce GTX480和GeForce GTX470是基于Fermi架构的第一代产品,其核心架构基本一致,所支持的特效和产品特性也基本相同。不同之处在于为了能够实现性能上的差异,GeForce GTX470比GeForce GTX480在核心内部减了一些Stream Multiprocessor,从而使得GeForce GTX470的性能略低于GeForce GTX480。然而,事实上就算是GeForce GTX480的规格也并非与之前我们讨论的Fermi完全相同,GeForce GTX480同样在核心架构上做了一定的简化。换句话说,NVIDIA显然在Fermi这个平台上留了后手,这应该是为了应付不久之后必然出现AMD反扑做准备。这在之前的几轮的3D显示核心竞争中已经是一种常态了。

那么GeForce GTX480和GeForce GTX470做了哪些简化呢?最直观的就是GeForce GTX480和GeForce GTX470的CUDA Core数量并不是Fermi标准的512个。512个CUDA Core被分成4组GPC,每组GPC包含4组SM单元,每组SM单元包含32个CUDA Core。而GeForce GTX480相对于Fermi而言,减少了32个CUDA Core,其核心数量为480个CUDA Core;至于GeForceGTX470则在GeForce GTX480的基础上再减少32个CUDA Core,其CUDA Core的数量为448个。这样一来,相当于GeForce GTX480比Fermi少了一组SM单元,而GeForce GTX470少了两组SM单元。
由于在Fermi的SM处理单元里还集成了独立的材质单元和多边形引擎(该引擎直接影响到芯片的几何性能),因此GeForce GTX480和GeForce GTX470在材质和几何运算方面性能也有所下降。GeForce GTX480拥有60个材质单元及15个多边形引擎;而GeForce GTX470则仅有56个材质单元和14个多边形引擎。由于Fermi的ROP是独立在GP C架构外的,因此即便是简化版的GeForce GTX480也拥有全部的ROP引擎,每一个ROP均具备单周期输出8个32bit整数型像素数据的能力,全部ROP可以单周期输出48个像素数据。而GeForce GTX470就没有这么幸运了,GeForce GTX470减少了一组ReP,因此其单周期像素数据输出为40个32bit整数型像素数据。
完整的Fermi支持384bit GDDR5显存位宽,每个内存控制器提供64bit显存位宽。因此GeForce GTX480同样支持384bit GDDR5显存,每个控制器可以控制256MB显存,因此GeForoe GTX480最大可支持1.5GBGDDR5显存,在924MHz显存频率下,其显存带宽为177GBps。而GeForce GTX470则仅能支持320bit显存位宽,最大支持1.25GBGDDR5显存,并且显存频率也要略低一下,其显存频率为837MHz,因而GeForce GTX470的显存带宽为134GBps。
经过简化后的Fermi,在性能上与最初设计的规格相比,恐怕会有一些下降。不过考虑到这些产品是在AMD的RadeonHD5870和Radeon HD5850之后推出的,NVIDIA没有理由让自己的最新旗舰级产品的性能低于竞争对手的产品,因此可以预见的是这两款产品的性能应该会高于AMD的两款产品。但恐怕这两款产品的性能无法达到预期的GeForce GTX285性能的两倍了。
GeForce GTX480和GTX470
我们手头的GeForce GTX480和GeForce GTX470均为华硕送来的工程样品,两款产品均采用NVIDIA官方的公版设计。GeForce GTX480的PCB板尺寸为10.5英寸,需要1根8pin和1根6pin独立供电电源才能稳定工作.其设计功耗为250W。虽然其峰值功耗算不上太夸张,但我们仍然建议用户使用600W电源来搭配GeForce GTX480使用。同时,由于显卡满负荷工作时的稳定较高,因此GeForce GTX480配备了一套十分夸张的散热系统,这套散热系统由5条内循环热管和一组体积十分庞大的铝质切割工艺鳍片组成,以确保显卡可以稳定的工作。
相对而言,GeForce GTX470就要小巧一些,GeForce GTX470的PCB板尺寸为9.5英寸,需要2跟6pin独立供电来弥补PCI-E插槽供电不足的问题。相对而言,GeForce GTX470的功耗要小一些,其设计的峰值功耗为200W,500W的电源也能够让GeForce GTX470稳定的运行。同时,由于功耗相对较低。GeForce GTX470的散热器也不想GeForce GTX480那么夸张,只是普通的OTES散热器,并没有配备热管。

至于两款产品的规格其实在之前的文章中已经讨论过了,这里附上一个详细的规格配置表供读者对比使用。总体来说,这两款产品的基本硬件配置并没有太出人意料的地方,算得上是中规中矩吧,不过GeForce GTX480那庞大而沉重的散热装置着实比较吓人,安装在机箱内最好做好固定工作,否则无论是出于其他配件安全考虑,还是GeForce GTX480自己的PCB强度,都会受到严峻的考验。
新功能
其实从严格意义上来说,GeForce GTX470和GeForce GTX480支持的特性也不能算是完全的新特性。比如说,GeForce GTX470和GeForce GTX480支持DirectX11、支持光线追踪技术、支持SLi、支持PhysX技术、支持PureVideo HD技术,除了DirectX 11,其他都不能算作是新技术、 新功能了。另外,它们还支持32x CSAA全屏抗锯齿和Surround技术,这两项技术中,32x CSAA全屏抗锯齿技术之前的产品从性能上就无法实现,而GeForce GTX470和GeForce GTX480的性能足够强悍,因此可以支持;而Surround技术则是一套环幕多显示器输出技术,显然是针对竞争对手的类似技术而推出的。
真正值得一提的恐怕只有对DirectX 11的支持了。DirectX 11的一个重大变化是将Tessellation功能作为DirectX 11的标准功能,而不再是某一厂商的特色技术。这就意味着未来会有越来越多的游戏针对Tessellation进行设计。Tesselation(细分曲面技术),实际上是由AMD研发的一项技术,该技术可以利用GPU在几何构成阶段,不断细化模型表面,从而创建出更为精密的模型。而对于设计人员来说,则不需要进行复杂的建模过程,只要按照正常模式建模,其他工作可由支持该技术的GPU完成。
不过由于该技术会消耗掉大量的显卡资源,因此只有在一些特殊情况下才会使用,比如镜头视角距离目标物体很近的情况,使用Tessellation可以让画面的质感大为提升。而大多数情况下,并不一定需要Tessellation功能。现在,既然Tesseliation已经成为DirectX 11的标准功能,那么NVIDIA也必须支持该功能才行。也正是因为如此,NVIDIA才在Fermi上启用了全新的并行架构,以便获取更好的Tessellation性能。从NVIDIA放出的演示Demo来看,Fermi做的还是相当不错的。
另外一项值得我们注意的技术就是全新的32x CSAA全屏抗锯齿技术了,正如前面所说的,这相技术完全得益于Fermi的全新设计和超强的性能,可以在不损失太多性能的情况下,实现更好的显示效果。此外,由于GeForce GTX470和GeForce GTX480的性能足够强劲,可以最高支持2560×1600的超高分辨率,因此实现Surround环绕多屏输出也就是顺理成章的事情了。而基于CUDA Core的并行异构计算能力,使用GeForce GTX470和GeFore GTX480来从事一些运算强度大的科学计算是相当不错的选择。而一如既往强悍的PureVideo HD可以让GeForce GTX470和GeForce GTX480轻松的实现高清视频的硬解码加速功能,但是对于HTPC用户来说GeFome GTX470和GeForce GTX480可不是合适的选择。
性能测试
作为NVIDIA最新一代的旗舰级产品,这两款显卡的性能毫无疑问是顶级的,因此实际上大家所关心的并不是“它们到底强不强?”,而是“它们到底有多强?”。而我们的测试则是对种种疑问最好的证明。关于这两款显卡的测试,我们使用了相对简单的脚本,这是因为对于顶级显卡来说,测试更多的项目依然是只能证明它们很强大,它们可以在更高的分辨率下,打开更多的特效,而且还能流畅的运行最消耗显卡资源的3D游戏。而且由于目前基本上没有什么针对DirectX 11设计的3D游戏,所以过于复杂的测试意义不大,只要能体现出GeForce GTX480和GeForce 470的强大即可。
为了能够体现出这两款显卡的性能优势,我们特别选择了一款GeForce GTX285作为对比测试平台。测试项目比较传统,包括3DMark Vantage、StreetFighter 4、H.A.W.X,以及著名的FarCry 2。除去标准测试3DMarkVantage外,其他三项游戏测试项目对CPU性能的要求都不高,刚好可以完整体现出被测显卡的性能。测试设置方面,对于3DMark Vantage,我们使用的是最高画质测试;对于游戏项目,则是开启了8×抗锯齿、8×各异向过滤,同时打开游戏可支持的最高分辨率,并设置成特效全开模式进行测试。
从测试成绩来看,GeForce GTX480和GeForce GTX470的性能十分了得,与之前的一代产品相比,性能提升显著。这就不免让人开始期待完整版本的Fermi了,毕竟这两款产品在架构上进行了一定程度的简化,性能表现并不能与完整版的Fermi相比。截止到本文发稿之日,名为GeForce GTX490的单卡双芯片架构产品已经确定将于2010年秋季发布。不过从单卡双芯片这种架构来看,GeForce GTX490搭载的两颗Fermi架构核心,应该也不是完整版的512颗CUDA Core核心产品,甚至其单颗芯片有可能比GeForce GTX480的CUDA Core数量还要少。到底何时才能见到最强的完整版Fermi呢?
不过对于大众用户来说,与其关注512Core的旗舰级产品,不如关心一下主流产品,或者是中低端产品。因为旗舰级的产品并不是大众用户所能接受的,而且想要配备旗舰级的显卡,在其他配件方面必然不能随便搭配。而价格更低廉的主流产品和面向入门级用户的产品,除了价格便宜且支持最新的功能外,还有一个重要因素,那就是适应能力要比高端旗舰级产品更好。至少旗舰级的产品是不会出现在用户的HTPC中,而入门级的产品往往会以视频解码作为卖点,同时这些产品应付一般游戏也完全没有问题。