向巅峰迈进

来源 :个人电脑 | 被引量 : 0次 | 上传用户:sketchupbim
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
  纵观近两年的3D显示卡市场,无论是AMD还是NVIDIA的产品动作相对于前些年而言,都变得缓慢了不少。新显卡推出的速度明显见慢,这里所谓的新产品指的是核心、架构上有重大改变的产品,而不是经过一些小小的修改而推出的所谓“新品”。虽然看起来这两年显卡新品数量并不算太少,但实际上大多数是改进自之前的产品,或是将之前的产品重新定位、命名(比如新的常青树GeForce GTX250)后的产品。
  
  这种现象实际上主要是由应用模式决定的——在3D应用需求大环境变化不大的情况下,盲目的推出新产品不见得会占到什么便宜,不如更新一些更符合当前应用需求的产品,这些产品更易被用户接受。毫无疑问,3D显示卡对于普通民用级电脑来说,其主要作用是运行3D游戏。而最近一段时间,3D游戏对性能的需求并未有太大突破。从近期发售的一些3D游戏不难看出这一点来。
  首先,对于网络游戏而言,为了能够让绝大多数用户的电脑都能流畅的运行,以便获取最大数量的在线用户,网络游戏通常并不需要特别强悍的显卡来支持,即便是《魔兽世界》,一般的显卡也能比较轻松的跑下来。其次,就单机游戏而言,目前大多数游戏公司,比如EA、UBi,甚至是日本的Capcom,开发的游戏都是多平台、全机种同时支持。那么为了照顾性能相对较低的Console Gaine平台,比如Xbox 360或是PS3,其游戏的3D特效就不可能做的特别夸张,否则Console Gaine平台将很难流畅的运行这些游戏,这对于Console Game玩家而言是不可接受的。由此,当这些跨平台的单机游戏出现在PC上时,往往仅仅是分辨率更高,支持更高倍的抗锯齿,或者是仅仅增加小部分3D特效。这就让这些游戏对显卡的需求也不会很高。而传统的FPS射击类游戏,近年来也并未出现疯狂消耗3D显卡性能的全新3D引擎。
  基于这种情况,有必要推出新的3D显示核心吗?不如继续完善当前核心,推出一些针对视频应用的功能和技术,吸引不太玩3D游戏的用户购买适当的3D显示卡产品来的划算。但是Direct X11已经出现,再固守在之前的产品上,恐怕就要失去未来的市场。所以推出新产品势在必行。目前AMD在这方面已经领先一步推出了新产品,而NVIDIA也随后推出了采用Fermi(GF100)核心架构的新产品GeForce GTX480和GeForce GTX470。
  
  Fermi猜想
  早在2009年,NVIDIA就对外宣布了Fermi的存在,一时间各种预测遍布互联网。可见用户对于NVIDIA的新产品充满了好奇。当时大家普遍认为Fermi应该叫“GT300”,因为之前的一代核心也就是我们熟悉的GeForce GTX 285系列产品的核心编号为GT200。而当Fermi正式出现在我们面前的时候,却使用了一个让我们颇感意外的“GF100”。那么,从GT到GF,究竟有什么样的改变呢?


  首先,Fermi的架构源自之前的GT200,也就是Tesla;而GT200则起源于更早的G80核心。这主要是指在统一渲染架构体系这一点而言,但Fermi不应该,也不可能完全与之前的产品相同,仅靠在旧有架构上增加Stream Processor数量来换取性能提升。这种做法会直接导致晶体管数量的几何级增长,随之而来问题还有温度、功耗、芯片面积等问题。对于Fermi而言,其内部渲染核心,也就是我们比较熟悉的Stream Processor,正式更名为CUDA Core,并且在整体架构设计方面有了较大的变化,但统一渲染架构的基本思路并未改变。而且CUDA架构原本就支持异构计算模式,而Stream Processor不足以让用户认识到这一点,而CUDA Core则更强调GeForce显示核心出色的异构计算能力,改名也就算是顺理成章。
  我们知道,GT200系列最强悍的单芯片GPU GeForce GTX285的CUDA Core数量为240个;而Fermi的CUDA Core数量为512个。在这种情况下,即便不做其他改动,仅靠CUDA Core数量的增长,也会获得至少2倍于GeForce GTX285的性能提升。之前GT200核心架构中,支持10组被称之为Texture Processing Clusters(材质处理集群,TPC)的处理区块,每一组TPC具有三组Streaming Multiprocessors(流式多路处理单元,SM),这些Streaming Multiprocessors内部包含8个SP及8个材质处理单元。而现在这个架构进一步进化成设计的更为精巧的资源整合型结构——Fermi将所有这些资源,整合成4个功能区块——这就是Fermi的核心架构Graphic ProcessorClusters(图形处理集群,GPC)。
  这些被称之为GPC的运算集群取代了之前的TPC,并且将之前在独立于TPC之外的功能模块整合进Fermi的GPC运算集群中来。Fermi的GPC运算集群包括升级到4组SM的GPC光栅引擎,每一组SM包括32个CUDA Core,同时集成4组专用材质单元,这些材质单元支持双路动态线程调度技术,并且具备64K B独立可编程共享缓存。从数量上来看,GT200的材质单元要比Fermi更多,GT200每一组TPC中包含8个材质单元,而一颗GPU中则有10组TPC;而Fermi核心每一组SM配备4个材质单元,总计64个材质单元。但由于Fermi的每个材质单元没每个时钟周期内可以完成一个材质运算,并获取4个材质样本,所以从实际性能上来看,Fermi架构实际上是要优于之前的GT200的。
  Fermi的线程调度则由全新的GigaThread引擎完成,负责给Fermi的16组SM分配渲染任务。GigaThread是Fermi架构的重要核心部分,这套引擎可以并行创建并指派线程,较之之前的单线程轮询过程要更为高效。当然,GigaThread引擎同样要从显存中获取数据,所以乍看上去Fermi的6组64bit,总计384bit的显存位宽,好像要比GT200的8组64bit,总计512bit显存位宽来得差一些。然而,NVIDIA这次给Fermi配备的是GDDR5显存,GDDR5的带宽本身就要比GDDR3更高,因此实际上Fermi并不需要过多的显存控制器,也能获取较高的显存带宽。


  在Fermi架构中,处于最末端的是6组ROP(Raster Operater Unit,光栅处理单元),这些ROP在同时输出8个32bn整数型像素。相对而言,之前的GT200的8组ROP在单个时钟周期内只能输出4个整数型像素。虽然Fermi仍然保持单周期64bit内存 控制器模式,但将每周期输出32个整数型像素提升到了每周期输出48个整数型像素。因而,Fermi可以支持一种全新的全屏抗锯齿模式——32x CSAA模式。并且,在32xCSAA模式下,只比8x MSAA模式损失约10%的性能。
  总体来说,Fermi在之前的统一渲染架构基础上,进行了大刀阔斧的改进,其主要目的自然是为了实现更真实的3D特效,新架构在几何运算方面较之之前的产品更有优势,几何运算能力则直接影响到3D建模的精细度和性能,而这正是“精确真实的世界”的基础。同时,新架构对CUDA异构计算更为有利,执行效率较之前代产品有不小的提升,此外针对这一架构进行异构计算的程序开发也会更为简便。
  
  缩水的Fermi
  之所以将这两款GeForce GTX产品放在一起来谈,主要是因为GeForce GTX480和GeForce GTX470是基于Fermi架构的第一代产品,其核心架构基本一致,所支持的特效和产品特性也基本相同。不同之处在于为了能够实现性能上的差异,GeForce GTX470比GeForce GTX480在核心内部减了一些Stream Multiprocessor,从而使得GeForce GTX470的性能略低于GeForce GTX480。然而,事实上就算是GeForce GTX480的规格也并非与之前我们讨论的Fermi完全相同,GeForce GTX480同样在核心架构上做了一定的简化。换句话说,NVIDIA显然在Fermi这个平台上留了后手,这应该是为了应付不久之后必然出现AMD反扑做准备。这在之前的几轮的3D显示核心竞争中已经是一种常态了。


  那么GeForce GTX480和GeForce GTX470做了哪些简化呢?最直观的就是GeForce GTX480和GeForce GTX470的CUDA Core数量并不是Fermi标准的512个。512个CUDA Core被分成4组GPC,每组GPC包含4组SM单元,每组SM单元包含32个CUDA Core。而GeForce GTX480相对于Fermi而言,减少了32个CUDA Core,其核心数量为480个CUDA Core;至于GeForceGTX470则在GeForce GTX480的基础上再减少32个CUDA Core,其CUDA Core的数量为448个。这样一来,相当于GeForce GTX480比Fermi少了一组SM单元,而GeForce GTX470少了两组SM单元。
  由于在Fermi的SM处理单元里还集成了独立的材质单元和多边形引擎(该引擎直接影响到芯片的几何性能),因此GeForce GTX480和GeForce GTX470在材质和几何运算方面性能也有所下降。GeForce GTX480拥有60个材质单元及15个多边形引擎;而GeForce GTX470则仅有56个材质单元和14个多边形引擎。由于Fermi的ROP是独立在GP C架构外的,因此即便是简化版的GeForce GTX480也拥有全部的ROP引擎,每一个ROP均具备单周期输出8个32bit整数型像素数据的能力,全部ROP可以单周期输出48个像素数据。而GeForce GTX470就没有这么幸运了,GeForce GTX470减少了一组ReP,因此其单周期像素数据输出为40个32bit整数型像素数据。
  完整的Fermi支持384bit GDDR5显存位宽,每个内存控制器提供64bit显存位宽。因此GeForce GTX480同样支持384bit GDDR5显存,每个控制器可以控制256MB显存,因此GeForoe GTX480最大可支持1.5GBGDDR5显存,在924MHz显存频率下,其显存带宽为177GBps。而GeForce GTX470则仅能支持320bit显存位宽,最大支持1.25GBGDDR5显存,并且显存频率也要略低一下,其显存频率为837MHz,因而GeForce GTX470的显存带宽为134GBps。
  经过简化后的Fermi,在性能上与最初设计的规格相比,恐怕会有一些下降。不过考虑到这些产品是在AMD的RadeonHD5870和Radeon HD5850之后推出的,NVIDIA没有理由让自己的最新旗舰级产品的性能低于竞争对手的产品,因此可以预见的是这两款产品的性能应该会高于AMD的两款产品。但恐怕这两款产品的性能无法达到预期的GeForce GTX285性能的两倍了。
  
  GeForce GTX480和GTX470
  
  我们手头的GeForce GTX480和GeForce GTX470均为华硕送来的工程样品,两款产品均采用NVIDIA官方的公版设计。GeForce GTX480的PCB板尺寸为10.5英寸,需要1根8pin和1根6pin独立供电电源才能稳定工作.其设计功耗为250W。虽然其峰值功耗算不上太夸张,但我们仍然建议用户使用600W电源来搭配GeForce GTX480使用。同时,由于显卡满负荷工作时的稳定较高,因此GeForce GTX480配备了一套十分夸张的散热系统,这套散热系统由5条内循环热管和一组体积十分庞大的铝质切割工艺鳍片组成,以确保显卡可以稳定的工作。
  相对而言,GeForce GTX470就要小巧一些,GeForce GTX470的PCB板尺寸为9.5英寸,需要2跟6pin独立供电来弥补PCI-E插槽供电不足的问题。相对而言,GeForce GTX470的功耗要小一些,其设计的峰值功耗为200W,500W的电源也能够让GeForce GTX470稳定的运行。同时,由于功耗相对较低。GeForce GTX470的散热器也不想GeForce GTX480那么夸张,只是普通的OTES散热器,并没有配备热管。


  至于两款产品的规格其实在之前的文章中已经讨论过了,这里附上一个详细的规格配置表供读者对比使用。总体来说,这两款产品的基本硬件配置并没有太出人意料的地方,算得上是中规中矩吧,不过GeForce GTX480那庞大而沉重的散热装置着实比较吓人,安装在机箱内最好做好固定工作,否则无论是出于其他配件安全考虑,还是GeForce GTX480自己的PCB强度,都会受到严峻的考验。
  
  新功能
  其实从严格意义上来说,GeForce GTX470和GeForce GTX480支持的特性也不能算是完全的新特性。比如说,GeForce GTX470和GeForce GTX480支持DirectX11、支持光线追踪技术、支持SLi、支持PhysX技术、支持PureVideo HD技术,除了DirectX 11,其他都不能算作是新技术、 新功能了。另外,它们还支持32x CSAA全屏抗锯齿和Surround技术,这两项技术中,32x CSAA全屏抗锯齿技术之前的产品从性能上就无法实现,而GeForce GTX470和GeForce GTX480的性能足够强悍,因此可以支持;而Surround技术则是一套环幕多显示器输出技术,显然是针对竞争对手的类似技术而推出的。
  真正值得一提的恐怕只有对DirectX 11的支持了。DirectX 11的一个重大变化是将Tessellation功能作为DirectX 11的标准功能,而不再是某一厂商的特色技术。这就意味着未来会有越来越多的游戏针对Tessellation进行设计。Tesselation(细分曲面技术),实际上是由AMD研发的一项技术,该技术可以利用GPU在几何构成阶段,不断细化模型表面,从而创建出更为精密的模型。而对于设计人员来说,则不需要进行复杂的建模过程,只要按照正常模式建模,其他工作可由支持该技术的GPU完成。
  不过由于该技术会消耗掉大量的显卡资源,因此只有在一些特殊情况下才会使用,比如镜头视角距离目标物体很近的情况,使用Tessellation可以让画面的质感大为提升。而大多数情况下,并不一定需要Tessellation功能。现在,既然Tesseliation已经成为DirectX 11的标准功能,那么NVIDIA也必须支持该功能才行。也正是因为如此,NVIDIA才在Fermi上启用了全新的并行架构,以便获取更好的Tessellation性能。从NVIDIA放出的演示Demo来看,Fermi做的还是相当不错的。
  另外一项值得我们注意的技术就是全新的32x CSAA全屏抗锯齿技术了,正如前面所说的,这相技术完全得益于Fermi的全新设计和超强的性能,可以在不损失太多性能的情况下,实现更好的显示效果。此外,由于GeForce GTX470和GeForce GTX480的性能足够强劲,可以最高支持2560×1600的超高分辨率,因此实现Surround环绕多屏输出也就是顺理成章的事情了。而基于CUDA Core的并行异构计算能力,使用GeForce GTX470和GeFore GTX480来从事一些运算强度大的科学计算是相当不错的选择。而一如既往强悍的PureVideo HD可以让GeForce GTX470和GeForce GTX480轻松的实现高清视频的硬解码加速功能,但是对于HTPC用户来说GeFome GTX470和GeForce GTX480可不是合适的选择。
  
  性能测试
  作为NVIDIA最新一代的旗舰级产品,这两款显卡的性能毫无疑问是顶级的,因此实际上大家所关心的并不是“它们到底强不强?”,而是“它们到底有多强?”。而我们的测试则是对种种疑问最好的证明。关于这两款显卡的测试,我们使用了相对简单的脚本,这是因为对于顶级显卡来说,测试更多的项目依然是只能证明它们很强大,它们可以在更高的分辨率下,打开更多的特效,而且还能流畅的运行最消耗显卡资源的3D游戏。而且由于目前基本上没有什么针对DirectX 11设计的3D游戏,所以过于复杂的测试意义不大,只要能体现出GeForce GTX480和GeForce 470的强大即可。
  为了能够体现出这两款显卡的性能优势,我们特别选择了一款GeForce GTX285作为对比测试平台。测试项目比较传统,包括3DMark Vantage、StreetFighter 4、H.A.W.X,以及著名的FarCry 2。除去标准测试3DMarkVantage外,其他三项游戏测试项目对CPU性能的要求都不高,刚好可以完整体现出被测显卡的性能。测试设置方面,对于3DMark Vantage,我们使用的是最高画质测试;对于游戏项目,则是开启了8×抗锯齿、8×各异向过滤,同时打开游戏可支持的最高分辨率,并设置成特效全开模式进行测试。
  从测试成绩来看,GeForce GTX480和GeForce GTX470的性能十分了得,与之前的一代产品相比,性能提升显著。这就不免让人开始期待完整版本的Fermi了,毕竟这两款产品在架构上进行了一定程度的简化,性能表现并不能与完整版的Fermi相比。截止到本文发稿之日,名为GeForce GTX490的单卡双芯片架构产品已经确定将于2010年秋季发布。不过从单卡双芯片这种架构来看,GeForce GTX490搭载的两颗Fermi架构核心,应该也不是完整版的512颗CUDA Core核心产品,甚至其单颗芯片有可能比GeForce GTX480的CUDA Core数量还要少。到底何时才能见到最强的完整版Fermi呢?
  不过对于大众用户来说,与其关注512Core的旗舰级产品,不如关心一下主流产品,或者是中低端产品。因为旗舰级的产品并不是大众用户所能接受的,而且想要配备旗舰级的显卡,在其他配件方面必然不能随便搭配。而价格更低廉的主流产品和面向入门级用户的产品,除了价格便宜且支持最新的功能外,还有一个重要因素,那就是适应能力要比高端旗舰级产品更好。至少旗舰级的产品是不会出现在用户的HTPC中,而入门级的产品往往会以视频解码作为卖点,同时这些产品应付一般游戏也完全没有问题。
其他文献
在鹊巢鸠占之后,我们所熟悉的Garmin被迫有了个新名字叫“佳明”。虽然中文名字改变了,但是Garmin产品的品质却依然如故。无论是在硬件配置还是软件功能方面,佳明的产品都有着过人之处,我们收到的这款1455+则是将GPS与流动测速预警设备完美的结合到一起。  Garmin nüvi 1455+提供了一个分辨率为480×272的防眩光触摸屏,即便在阳光下也能保持不错的效果。与以往的车载GPS导航设
期刊
对经常出差的IT人来说,除非坐商务舱,飞机旅行很少会是愉快的体验。充分利用各种科技手段来让这段难熬的时间变的更舒服、更有价值显然是很有必要的。  在航空旅行的话题中,提到互联网大家都想到网上订票,其实买票之后互联网也有用。所有的航空公司现在都提供网络check-in服务,如果不想在机场柜台排队,或者连行李都不用托运,在家里登陆航空公司网站办好登机手续并打印登机牌是很好的主意。  在网上check-
期刊
编辑评价    联想昭阳E46A有着出色的安全性,可保证数据万无一失;可信赖的可靠性能有效减少由于意外造成的设备损坏或是数据丢失;按需定制的服务可为不同用户量身打造。值得称赞的是,其全年无休的售后服务也着实令人感到放心。    产品信息    ◆价格 定制  ◆厂商 联想集团有限公司  ◆电话 800--810--8888  ◆网址www.lenovo.com.cn    硬件配置    ◆处理器
期刊
2010年10月中国液晶显示器市场中,19英寸产品的关注比例下降,同时21.5英寸产品的关注度提升。23英寸产品市场的整体关注比例在经过将近半年的连续上升之后,于10月出现小幅度回落。主流品牌中,三星继续在市场中保持较大的优势,其在19英寸、21.5英寸、23英寸等主流尺寸市场中的关注份额均比9月份有所提升。整体市场上,三星、AOC关注比例同比获得提升,19英寸市场三星关注度回升,21.5英寸与1
期刊
Canon智简iR—ADV C2020    编辑评价    C2020提供了丰富的办公手段,它具备先进的数码复印,网络打印以及数码发送功能。它的纸张处理能力强,能添加种类繁多的扩展配件。同时C2020出色的功能易用性也令人印象深刻。无论是成长型的新兴公司,还是那些成熟的大型工作组级用户,C2020都能找到比较合适的位置。    产品信息  ◆价格 31500元(主机,不包括选配件)  ◆厂商 佳
期刊
编辑评价  从电池模块的位置和安装方式来看,ThinkPad T410s无法更换更大容量的电池,而只能通过托架形式来实现更长的电池续航能力,的确是个遗憾,但这并不会让我们对它有任何失望的感觉。ThinkPad T410s完美的接口位置设计,丰富的扩展能力,优秀的工艺和可靠的品质证明,它是一款相当出色的商用笔记本电脑!对ThinkPadT410s来说,其价格可能永远是让人难以满意之处。  作为Thi
期刊
定位高密度计算!    当用户对在IU的空间中放置标准的一路或者两路的处理器的情况已司空见惯之际,双子星的出现曾引起了业界的极大震动。而随着人们对单位计算性能要求的不断提高,双子星服务器凭借自身架构上的优势再次吸引了众多用户的关注。近日,国内最大的服务器配件分销商——信维国际再次强势推出了两款高性能双子星服务器,为用户搭建高密度计算平台提供了新的选择。  全新推出的华硕双子星RS700D-E6/P
期刊
编辑评价  顶尖的核心技术与完美的工艺设计相结合,构成了理想的商务PC平台;领先的节能设计和可靠的安全机制进一步提升了产品的内在价值。  尽管传统台式机在PC市场上的占有率已经被笔记本电脑超越了,但是由于整个市场是在不断成长的,因此在销售量上始终保持着上升的趋势。从一些权威机构的调查数字中可以看出,笔记本电脑在消费领域的成长速度明显更迅速一些,而在商用计算领域中,传统的台式电脑仍然占有重要的位置,
期刊
三星电子一直在轻薄型笔记本设计方面独树一帜,随着英特尔新酷睿移动平台的发布,三星也在国内推出了各系列笔记本电脑新品,其中以轻薄著称的三星Q系列自然也位于其中。与其他品牌不同的是,三星在各个屏幕尺寸上均提供了轻薄的选择——三星Q230、Q330和Q430分别采用了12.1英寸、13.3英寸和14.0英寸,分辨率为1366×768的LED背光显示屏,除配备了英特尔最新酷睿i系列处理器之外,这三款产品都
期刊
5月18日,佳能(中国)有限公司商务影像方案部在北京健一公馆举行了主题为“物竞天择,先进者适”的新品发布会,正式面向中国市场推出“智简imageRUNNERADVANCE”新系列数码复合机。  在办公产品开发制造领域,佳能一直秉承“以人类与地球为中心”的理念,通过不断的技术积累与创新,将其追求的精髓凝缘成为此次的“智简imageRUNNERADVANCE”新系列数码复合机。新系列数码复合机集众多创
期刊