android - 如何在 Nvidia Shield 上正确计时 Android RenderScript 代码

coder 2023-12-02 原文

我已经在 RenderScript 中实现了一个小型 CNN，并且想分析不同硬件上的性能。在我的 Nexus 7 上，时间有意义，但在 NVIDIA Shield 上却没有。

CNN (LeNet) 在队列中的 9 层中实现，计算按顺序执行。每层单独计时。

这是一个例子:

       conv1  pool1 conv2  pool2 resh1 ip1    relu1  ip2    softmax
nexus7 11.177 7.813 13.357 8.367 8.097 2.1    0.326  1.557  2.667
shield 13.219 1.024 1.567  1.081 0.988 14.588 13.323 14.318 40.347

时间的分布对于 nexus 来说是正确的，conv1 和 conv2(卷积层)占据了大部分时间。但是在盾牌上，时间下降的方式远远超出了第 2-4 层的合理范围，并且似乎在接近尾声时聚集起来。 softmax 层是一个相对较小的工作，所以 40 毫秒太大了。一定是我的计时方法有问题，或者有其他问题。

运行层的代码看起来像这样:

double[] times = new double[layers.size()];
int layerindex = 0;
for (Layer a : layers) {

    double t = SystemClock.elapsedRealtime(); 
    //long t = System.currentTimeMillis(); // makes no difference

    blob = a.forward(blob); // here we call renderscript forEach_(), invoke_() etc

    //mRS.finish(); // makes no difference

    t = SystemClock.elapsedRealtime() - t; 
    //t = System.currentTimeMillis() - t; // makes no difference

    times[layerindex] += t; // later we take average etc

    layerindex++;
}

据我了解，一旦 forEach_() 返回，作业就应该完成。在任何情况下，mRS.finish() 都应该提供最后一道屏障。但纵观时代，唯一合理的解释是作业仍在后台处理。

应用程序非常简单，我只是从 MainActivity 运行测试并打印到 logcat。 Android Studio 将应用构建为一个版本，并在通过 USB 连接的设备上运行。

(1) 为 RenderScript 进程计时的正确方法是什么？ (2) 当 forEach_() 返回时，脚本生成的线程是否保证完成？ (3) 在我的测试应用程序中，我只是直接从 MainActivity 运行。这是一个问题吗(除了阻塞 UI 线程并使应用程序无响应)？如果这会影响时间或导致异常，那么像这样设置测试应用程序的正确方法是什么？

最佳答案

我自己在 RenderScript 中实现了 CNN，正如您所解释的，如果您将它们分别实现为不同的内核，它确实需要链接多个进程并为每一层多次调用 forEach_*() .因此，我可以向您保证，返回的 forEach 调用并不能真正保证该过程已完成。理论上，这只会安排内核，所有排队的请求实际上会在系统确定最佳运行时运行，尤其是当它们在平板电脑的 GPU 中得到处理时。

通常，要绝对确保您对真正运行的内核具有某种控制权的唯一方法是显式读取层间 RS 内核的输出，例如使用 .copyTo() 在该内核的输出分配对象上。这“强制”任何尚未运行的排队 RS 作业(该层的输出分配依赖于它)在那个时候执行。当然，这可能会引入数据传输开销，并且您的计时不会完全准确——事实上，如果以这种方式计时，整个网络的执行时间肯定会低于各个层的总和。但据我所知，这是为链中的单个内核计时的唯一可靠方法，它会为您提供一些反馈以找出瓶颈所在，并更好地指导您的优化，如果那是您所追求的。

关于android - 如何在 Nvidia Shield 上正确计时 Android RenderScript 代码，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/37080673/

计时何在 section 的 android multithreading performance timing renderscript

有关android - 如何在 Nvidia Shield 上正确计时 Android RenderScript 代码的更多相关文章

ruby - 如何在 Ruby 中顺序创建 PI - 2
出于纯粹的兴趣，我很好奇如何按顺序创建PI，而不是在过程结果之后生成数字，而是让数字在过程本身生成时显示。如果是这种情况，那么数字可以自行产生，我可以对以前看到的数字实现垃圾收集，从而创建一个无限系列。结果只是在Pi系列之后每秒生成一个数字。这是我通过互联网筛选的结果:这是流行的计算机友好算法，类机器算法:defarccot(x,unity)xpow=unity/xn=1sign=1sum=0loopdoterm=xpow/nbreakifterm==0sum+=sign*(xpow/n)xpow/=x*xn+=2sign=-signendsumenddefcalc_pi(digits
ruby - 如何在 buildr 项目中使用 Ruby 代码？ - 2
如何在buildr项目中使用Ruby？我在很多不同的项目中使用过Ruby、JRuby、Java和Clojure。我目前正在使用我的标准Ruby开发一个模拟应用程序，我想尝试使用Clojure后端(我确实喜欢功能代码)以及JRubygui和测试套件。我还可以看到在未来的不同项目中使用Scala作为后端。我想我要为我的项目尝试一下buildr(http://buildr.apache.org/)，但我注意到buildr似乎没有设置为在项目中使用JRuby代码本身!这看起来有点傻，因为该工具旨在统一通用的JVM语言并且是在ruby中构建的。除了将输出的jar包含在一个独特的、仅限ruby
ruby - 什么是填充的 Base64 编码字符串以及如何在 ruby 中生成它们？ - 2
我正在使用的第三方API的文档状态:"[O]urAPIonlyacceptspaddedBase64encodedstrings."什么是“填充的Base64编码字符串”以及如何在Ruby中生成它们。下面的代码是我第一次尝试创建转换为Base64的JSON格式数据。xa=Base64.encode64(a.to_json) 最佳答案他们说的padding其实就是Base64本身的一部分。它是末尾的“=”和“==”。Base64将3个字节的数据包编码为4个编码字符。所以如果你的输入数据有长度n和n%3=1=>"=="末尾用于填充n%
ruby-on-rails - Rails 源代码 : initialize hash in a weird way? - 2
在rails源中:https://github.com/rails/rails/blob/master/activesupport/lib/active_support/lazy_load_hooks.rb可以看到以下内容@load_hooks=Hash.new{|h,k|h[k]=[]}在IRB中，它只是初始化一个空哈希。和做有什么区别@load_hooks=Hash.new 最佳答案查看rubydocumentationforHashnew→new_hashclicktotogglesourcenew(obj)→new_has
ruby-on-rails - 如何在 ruby 中使用两个参数异步运行 exe？ - 2
exe应该在我打开页面时运行。异步进程需要运行。有什么方法可以在ruby中使用两个参数异步运行exe吗？我已经尝试过ruby命令-system()、exec()但它正在等待过程完成。我需要用参数启动exe，无需等待进程完成是否有任何rubygems会支持我的问题？最佳答案您可以使用Process.spawn和Process.wait2:pid=Process.spawn'your.exe','--option'#Later...pid,status=Process.wait2pid您的程序将作为解释器的子进程执行。除
ruby - 如何在续集中重新加载表模式？ - 2
鉴于我有以下迁移:Sequel.migrationdoupdoalter_table:usersdoadd_column:is_admin,:default=>falseend#SequelrunsaDESCRIBEtablestatement,whenthemodelisloaded.#Atthispoint,itdoesnotknowthatusershaveais_adminflag.#Soitfails.@user=User.find(:email=>"admin@fancy-startup.example")@user.is_admin=true@user.save!ende
ruby-on-rails - 如何使用 instance_variable_set 正确设置实例变量？ - 2
我正在查看instance_variable_set的文档并看到给出的示例代码是这样做的:obj.instance_variable_set(:@instnc_var,"valuefortheinstancevariable")然后允许您在类的任何实例方法中以@instnc_var的形式访问该变量。我想知道为什么在@instnc_var之前需要一个冒号:。冒号有什么作用？最佳答案我的第一直觉是告诉你不要使用instance_variable_set除非你真的知道你用它做什么。它本质上是一种元编程工具或绕过实例变量可见性的黑客攻击
ruby - 如何在 Ruby 中拆分参数字符串 Bash 样式？ - 2
我正在为一个项目制作一个简单的shell，我希望像在Bash中一样解析参数字符串。foobar"helloworld"fooz应该变成:["foo","bar","helloworld","fooz"]等等。到目前为止，我一直在使用CSV::parse_line，将列分隔符设置为""和.compact输出。问题是我现在必须选择是要支持单引号还是双引号。CSV不支持超过一个分隔符。Python有一个名为shlex的模块:>>>shlex.split("Test'helloworld'foo")['Test','helloworld','foo']>>>shlex.split('Test"
ruby - 如何在 Lion 上安装 Xcode 4.6，需要用 RVM 升级 ruby - 2
我实际上是在尝试使用RVM在我的OSX10.7.5上更新ruby，并在输入以下命令后:rvminstallruby我得到了以下回复:Searchingforbinaryrubies,thismighttakesometime.Checkingrequirementsforosx.Installingrequirementsforosx.Updatingsystem.......Errorrunning'requirements_osx_brew_update_systemruby-2.0.0-p247',pleaseread/Users/username/.rvm/log/138121
ruby-on-rails - 如何在 ruby 交互式 shell 中有多行？ - 2
这可能是个愚蠢的问题。但是，我是一个新手......你怎么能在交互式rubyshell中有多行代码？好像你只能有一条长线。按回车键运行代码。无论如何我可以在不运行代码的情况下跳到下一行吗？再次抱歉，如果这是一个愚蠢的问题。谢谢。最佳答案这是一个例子:2.1.2:053>a=1=>12.1.2:054>b=2=>22.1.2:055>a+b=>32.1.2:056>ifa>b#Thecode‘if..."startsthedefinitionoftheconditionalstatement.2.1.2:057?>puts"f

android - 如何在 Nvidia Shield 上正确计时 Android RenderScript 代码

有关android - 如何在 Nvidia Shield 上正确计时 Android RenderScript 代码的更多相关文章

随机推荐