首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >PHP-ML上内存不足

PHP-ML上内存不足
EN

Stack Overflow用户
提问于 2018-02-10 20:26:44
回答 1查看 1K关注 0票数 1

我正在尝试用PHP实现一个情感分析。我有一套训练数据,大约有15000条。我有代码工作,但是,我必须将设置的数据减少到100个条目才能工作。当我试图运行完整的数据集时,我会得到以下错误:

代码语言:javascript
复制
Fatal error: Allowed memory size of 134217728 bytes exhausted (tried to allocate 917504 bytes) in C:\Users\<username>\Documents\Github\phpml\vendor\php-ai\php-ml\src\Phpml\FeatureExtraction\TokenCountVectorizer.php on line 95

我拥有的两个文件是index.php:

代码语言:javascript
复制
<?php 

declare(strict_types=1);
namespace PhpmlExercise;

include 'vendor/autoload.php';

include 'SentimentAnalysis.php';

use PhpmlExercise\Classification\SentimentAnalysis;
use Phpml\Dataset\CsvDataset;
use Phpml\Dataset\ArrayDataset;
use Phpml\FeatureExtraction\TokenCountVectorizer;
use Phpml\Tokenization\WordTokenizer;
use Phpml\CrossValidation\StratifiedRandomSplit;
use Phpml\FeatureExtraction\TfIdfTransformer;
use Phpml\Metric\Accuracy;
use Phpml\Classification\SVC;
use Phpml\SupportVectorMachine\Kernel;

$dataset = new CsvDataset('clean_tweets2.csv', 1, true);
$vectorizer = new TokenCountVectorizer(new WordTokenizer());
$tfIdfTransformer = new TfIdfTransformer();
$samples = [];
foreach ($dataset->getSamples() as $sample) {
    $samples[] = $sample[0];
}
$vectorizer->fit($samples);
$vectorizer->transform($samples);
$tfIdfTransformer->fit($samples);
$tfIdfTransformer->transform($samples);
$dataset = new ArrayDataset($samples, $dataset->getTargets());
$randomSplit = new StratifiedRandomSplit($dataset, 0.1);

$trainingSamples = $randomSplit->getTrainSamples();
$trainingLabels     = $randomSplit->getTrainLabels();

$testSamples = $randomSplit->getTestSamples();
$testLabels      = $randomSplit->getTestLabels();

$classifier = new SentimentAnalysis();
$classifier->train($randomSplit->getTrainSamples(), $randomSplit->getTrainLabels());
$predictedLabels = $classifier->predict($randomSplit->getTestSamples());

echo 'Accuracy: '.Accuracy::score($randomSplit->getTestLabels(), $predictedLabels);

和SentimentAnalysis.php:

代码语言:javascript
复制
<?php

namespace PhpmlExercise\Classification;
use Phpml\Classification\NaiveBayes;

class SentimentAnalysis
{
    protected $classifier;

    public function __construct()
    {
        $this->classifier = new NaiveBayes();
    }
    public function train($samples, $labels)
    {
        $this->classifier->train($samples, $labels);
    }

    public function predict($samples)
    {
        return $this->classifier->predict($samples);
    }
}

我对机器学习和php-ml非常陌生,所以我不太确定如何推断出问题在哪里,或者是否有一种方法可以在没有大量内存的情况下修复这个问题。我最多能知道的是,这个错误发生在索引文件第22行的TokenCountVectorizer中。有人知道是什么原因导致了这个问题吗?

指向PHP的链接在这里:http://php-ml.readthedocs.io/en/latest/

谢谢

EN

回答 1

Stack Overflow用户

发布于 2018-10-17 20:12:33

此错误来自于将更多的PHP加载到内存中,而不是在一个进程中设置PHP来处理。还有其他原因,但这些原因并不常见。

在您的例子中,PHP实例似乎被配置为允许最多使用128 of的内存。在机器学习中,这不是很多,如果您使用大型数据集,您将非常肯定地达到这个限制。

若要更改允许PHP用于1GB的内存量,可以编辑php.ini文件并设置

代码语言:javascript
复制
memory_limit = 1024M

如果您无法访问您的php.ini文件,但仍然拥有更改设置的权限,则可以在运行时使用

代码语言:javascript
复制
<?php
    ini_set('memory_limit', '1024M');

或者,如果运行Apache,可以尝试使用.htaccess文件指令设置内存限制。

代码语言:javascript
复制
php_value memory_limit 1024M

请注意,大多数共享托管解决方案等对允许使用的内存数量有很大的限制,而且通常是很低的。

其他你可以帮助的事情是

  • 如果您从文件中加载数据,请查看fgetsSplFileObject::fgets,以便逐行加载读取的文件,而不是一次将完整的文件读入内存。
  • 确保您正在运行一个尽可能最新的PHP版本
  • 确保PHP扩展是最新的
  • 禁用不使用的PHP扩展
  • unset数据或已完成且不再需要内存的大型对象。请注意,PHP的垃圾收集器不一定会立即释放内存。相反,通过设计,当它感到所需的CPU周期存在或脚本即将耗尽内存之前,它就会这样做,不管首先发生什么。
  • 您可以使用类似echo memory_get_usage() / 1024.0 . ' kb' . PHP_EOL;的东西在程序中给定的位置打印内存使用情况,以尝试并分析不同部分使用了多少内存。
票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/48725242

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档