U
    <ºc6  ã                   @   sJ  d dl Z d dlZd dlZd dlmZmZmZmZmZm	Z	m
Z
mZmZ d dlmZmZ d dlmZ ddlmZmZ ddd	d
dddgZedddZedƒZG dd„ dee ƒZG dd„ dee ƒZG dd	„ d	ee
edf  ƒZG dd
„ d
ee ƒZG dd„ deƒZG dd„ dee ƒZefee e	eeef  ee eee  dœdd„Z dS )é    N)	ÚGenericÚIterableÚIteratorÚListÚOptionalÚSequenceÚTupleÚTypeVarÚUnion)Údefault_generatorÚrandperm)Ú_accumulateé   )Ú	GeneratorÚTensorÚDatasetÚIterableDatasetÚTensorDatasetÚConcatDatasetÚChainDatasetÚSubsetÚrandom_splitÚT_coT)Ú	covariantÚTc                   @   s.   e Zd ZdZedœdd„Zdddœdd	„Zd
S )r   aí  An abstract class representing a :class:`Dataset`.

    All datasets that represent a map from keys to data samples should subclass
    it. All subclasses should overwrite :meth:`__getitem__`, supporting fetching a
    data sample for a given key. Subclasses could also optionally overwrite
    :meth:`__len__`, which is expected to return the size of the dataset by many
    :class:`~torch.utils.data.Sampler` implementations and the default options
    of :class:`~torch.utils.data.DataLoader`.

    .. note::
      :class:`~torch.utils.data.DataLoader` by default constructs a index
      sampler that yields integral indices.  To make it work with a map-style
      dataset with non-integral indices/keys, a custom sampler must be provided.
    ©Úreturnc                 C   s   t ‚d S ©N©ÚNotImplementedError©ÚselfÚindex© r#   ú</tmp/pip-unpacked-wheel-gikjz4vx/torch/utils/data/dataset.pyÚ__getitem__4   s    zDataset.__getitem__zDataset[T_co]zConcatDataset[T_co])Úotherr   c                 C   s   t | |gƒS r   )r   ©r!   r&   r#   r#   r$   Ú__add__7   s    zDataset.__add__N)Ú__name__Ú
__module__Ú__qualname__Ú__doc__r   r%   r(   r#   r#   r#   r$   r   $   s   c                   @   s4   e Zd ZdZee dœdd„Zee dœdd„ZdS )	r   a–  An iterable Dataset.

    All datasets that represent an iterable of data samples should subclass it.
    Such form of datasets is particularly useful when data come from a stream.

    All subclasses should overwrite :meth:`__iter__`, which would return an
    iterator of samples in this dataset.

    When a subclass is used with :class:`~torch.utils.data.DataLoader`, each
    item in the dataset will be yielded from the :class:`~torch.utils.data.DataLoader`
    iterator. When :attr:`num_workers > 0`, each worker process will have a
    different copy of the dataset object, so it is often desired to configure
    each copy independently to avoid having duplicate data returned from the
    workers. :func:`~torch.utils.data.get_worker_info`, when called in a worker
    process, returns information about the worker. It can be used in either the
    dataset's :meth:`__iter__` method or the :class:`~torch.utils.data.DataLoader` 's
    :attr:`worker_init_fn` option to modify each copy's behavior.

    Example 1: splitting workload across all workers in :meth:`__iter__`::

        >>> class MyIterableDataset(torch.utils.data.IterableDataset):
        ...     def __init__(self, start, end):
        ...         super(MyIterableDataset).__init__()
        ...         assert end > start, "this example code only works with end >= start"
        ...         self.start = start
        ...         self.end = end
        ...
        ...     def __iter__(self):
        ...         worker_info = torch.utils.data.get_worker_info()
        ...         if worker_info is None:  # single-process data loading, return the full iterator
        ...             iter_start = self.start
        ...             iter_end = self.end
        ...         else:  # in a worker process
        ...             # split workload
        ...             per_worker = int(math.ceil((self.end - self.start) / float(worker_info.num_workers)))
        ...             worker_id = worker_info.id
        ...             iter_start = self.start + worker_id * per_worker
        ...             iter_end = min(iter_start + per_worker, self.end)
        ...         return iter(range(iter_start, iter_end))
        ...
        >>> # should give same set of data as range(3, 7), i.e., [3, 4, 5, 6].
        >>> ds = MyIterableDataset(start=3, end=7)

        >>> # Single-process loading
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=0)))
        [tensor([3]), tensor([4]), tensor([5]), tensor([6])]

        >>> # xdoctest: +REQUIRES(POSIX)
        >>> # Mult-process loading with two worker processes
        >>> # Worker 0 fetched [3, 4].  Worker 1 fetched [5, 6].
        >>> # xdoctest: +IGNORE_WANT("non deterministic")
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2)))
        [tensor([3]), tensor([5]), tensor([4]), tensor([6])]

        >>> # With even more workers
        >>> # xdoctest: +IGNORE_WANT("non deterministic")
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=12)))
        [tensor([3]), tensor([5]), tensor([4]), tensor([6])]

    Example 2: splitting workload across all workers using :attr:`worker_init_fn`::

        >>> class MyIterableDataset(torch.utils.data.IterableDataset):
        ...     def __init__(self, start, end):
        ...         super(MyIterableDataset).__init__()
        ...         assert end > start, "this example code only works with end >= start"
        ...         self.start = start
        ...         self.end = end
        ...
        ...     def __iter__(self):
        ...         return iter(range(self.start, self.end))
        ...
        >>> # should give same set of data as range(3, 7), i.e., [3, 4, 5, 6].
        >>> ds = MyIterableDataset(start=3, end=7)

        >>> # Single-process loading
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=0)))
        [3, 4, 5, 6]
        >>>
        >>> # Directly doing multi-process loading yields duplicate data
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2)))
        [3, 3, 4, 4, 5, 5, 6, 6]

        >>> # Define a `worker_init_fn` that configures each dataset copy differently
        >>> def worker_init_fn(worker_id):
        ...     worker_info = torch.utils.data.get_worker_info()
        ...     dataset = worker_info.dataset  # the dataset copy in this worker process
        ...     overall_start = dataset.start
        ...     overall_end = dataset.end
        ...     # configure the dataset to only process the split workload
        ...     per_worker = int(math.ceil((overall_end - overall_start) / float(worker_info.num_workers)))
        ...     worker_id = worker_info.id
        ...     dataset.start = overall_start + worker_id * per_worker
        ...     dataset.end = min(dataset.start + per_worker, overall_end)
        ...

        >>> # Mult-process loading with the custom `worker_init_fn`
        >>> # Worker 0 fetched [3, 4].  Worker 1 fetched [5, 6].
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2, worker_init_fn=worker_init_fn)))
        [3, 5, 4, 6]

        >>> # With even more workers
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=12, worker_init_fn=worker_init_fn)))
        [3, 4, 5, 6]
    r   c                 C   s   t ‚d S r   r   ©r!   r#   r#   r$   Ú__iter__¨   s    zIterableDataset.__iter__)r&   c                 C   s   t | |gƒS r   )r   r'   r#   r#   r$   r(   «   s    zIterableDataset.__add__N)	r)   r*   r+   r,   r   r   r.   r   r(   r#   r#   r#   r$   r   ?   s   hc                   @   sB   e Zd ZU dZeedf ed< eddœdd„Zdd	„ Zd
d„ Z	dS )r   zÎDataset wrapping tensors.

    Each sample will be retrieved by indexing tensors along the first dimension.

    Args:
        *tensors (Tensor): tensors that have the same size of the first dimension.
    .ÚtensorsN)r/   r   c                    s(   t ‡ fdd„ˆ D ƒƒstdƒ‚ˆ | _d S )Nc                 3   s&   | ]}ˆ d    d ¡|  d ¡kV  qdS )r   N)Úsize©Ú.0Ztensor©r/   r#   r$   Ú	<genexpr>½   s     z)TensorDataset.__init__.<locals>.<genexpr>zSize mismatch between tensors)ÚallÚAssertionErrorr/   )r!   r/   r#   r3   r$   Ú__init__¼   s    zTensorDataset.__init__c                    s   t ‡ fdd„| jD ƒƒS )Nc                 3   s   | ]}|ˆ  V  qd S r   r#   r1   ©r"   r#   r$   r4   Á   s     z,TensorDataset.__getitem__.<locals>.<genexpr>)Útupler/   r    r#   r8   r$   r%   À   s    zTensorDataset.__getitem__c                 C   s   | j d  d¡S ©Nr   )r/   r0   r-   r#   r#   r$   Ú__len__Ã   s    zTensorDataset.__len__)
r)   r*   r+   r,   r   r   Ú__annotations__r7   r%   r;   r#   r#   r#   r$   r   ²   s
   
.c                       sr   e Zd ZU dZeee  ed< ee ed< e	dd„ ƒZ
ee ddœ‡ fdd	„Zd
d„ Zdd„ Zedd„ ƒZ‡  ZS )r   zÄDataset as a concatenation of multiple datasets.

    This class is useful to assemble different existing datasets.

    Args:
        datasets (sequence): List of datasets to be concatenated
    ÚdatasetsÚcumulative_sizesc                 C   s6   g d }}| D ]"}t |ƒ}| || ¡ ||7 }q|S r:   )ÚlenÚappend)ÚsequenceÚrÚsÚeÚlr#   r#   r$   ÚcumsumÒ   s    

zConcatDataset.cumsumN©r=   r   c                    s^   t t| ƒ ¡  t|ƒ| _t| jƒdks.tdƒ‚| jD ]}t|tƒr4tdƒ‚q4|  	| j¡| _
d S )Nr   z(datasets should not be an empty iterablez.ConcatDataset does not support IterableDataset)Úsuperr   r7   Úlistr=   r?   r6   Ú
isinstancer   rF   r>   )r!   r=   Úd©Ú	__class__r#   r$   r7   Û   s    

zConcatDataset.__init__c                 C   s
   | j d S )Néÿÿÿÿ)r>   r-   r#   r#   r$   r;   ã   s    zConcatDataset.__len__c                 C   sf   |dk r*| t | ƒkrtdƒ‚t | ƒ| }t | j|¡}|dkrF|}n|| j|d   }| j| | S )Nr   z8absolute value of index should not exceed dataset lengthé   )r?   Ú
ValueErrorÚbisectÚbisect_rightr>   r=   )r!   ÚidxZdataset_idxZ
sample_idxr#   r#   r$   r%   æ   s    zConcatDataset.__getitem__c                 C   s   t jdtdd | jS )Nz:cummulative_sizes attribute is renamed to cumulative_sizesé   )Ú
stacklevel)ÚwarningsÚwarnÚDeprecationWarningr>   r-   r#   r#   r$   Úcummulative_sizesò   s
     ÿzConcatDataset.cummulative_sizes)r)   r*   r+   r,   r   r   r   r<   ÚintÚstaticmethodrF   r   r7   r;   r%   ÚpropertyrY   Ú__classcell__r#   r#   rL   r$   r   Ç   s   

c                       s<   e Zd ZdZee ddœ‡ fdd„Zdd„ Zdd	„ Z‡  Z	S )
r   a_  Dataset for chaining multiple :class:`IterableDataset` s.

    This class is useful to assemble different existing dataset streams. The
    chaining operation is done on-the-fly, so concatenating large-scale
    datasets with this class will be efficient.

    Args:
        datasets (iterable of IterableDataset): datasets to be chained together
    NrG   c                    s   t t| ƒ ¡  || _d S r   )rH   r   r7   r=   )r!   r=   rL   r#   r$   r7     s    zChainDataset.__init__c                 c   s2   | j D ]&}t|tƒstdƒ‚|D ]
}|V  q qd S )Nú*ChainDataset only supports IterableDataset)r=   rJ   r   r6   )r!   rK   Úxr#   r#   r$   r.     s    
zChainDataset.__iter__c                 C   s2   d}| j D ]"}t|tƒs tdƒ‚|t|ƒ7 }q
|S )Nr   r^   )r=   rJ   r   r6   r?   )r!   ÚtotalrK   r#   r#   r$   r;     s
    
zChainDataset.__len__)
r)   r*   r+   r,   r   r   r7   r.   r;   r]   r#   r#   rL   r$   r   ù   s   	c                   @   sT   e Zd ZU dZee ed< ee ed< ee ee ddœdd„Z	dd	„ Z
d
d„ ZdS )r   z´
    Subset of a dataset at specified indices.

    Args:
        dataset (Dataset): The whole Dataset
        indices (sequence): Indices in the whole set selected for subset
    ÚdatasetÚindicesN)ra   rb   r   c                 C   s   || _ || _d S r   ©ra   rb   )r!   ra   rb   r#   r#   r$   r7      s    zSubset.__init__c                    s2   t |tƒr"ˆ j‡ fdd„|D ƒ S ˆ jˆ j|  S )Nc                    s   g | ]}ˆ j | ‘qS r#   )rb   )r2   Úir-   r#   r$   Ú
<listcomp>&  s     z&Subset.__getitem__.<locals>.<listcomp>)rJ   rI   ra   rb   )r!   rS   r#   r-   r$   r%   $  s    
zSubset.__getitem__c                 C   s
   t | jƒS r   )r?   rb   r-   r#   r#   r$   r;   )  s    zSubset.__len__)r)   r*   r+   r,   r   r   r<   r   rZ   r7   r%   r;   r#   r#   r#   r$   r     s   
)ra   ÚlengthsÚ	generatorr   c           
         s&  t  t|ƒd¡rÜt|ƒdkrÜg }t|ƒD ]H\}}|dk s@|dkrPtd|› dƒ‚tt  tˆ ƒ| ¡ƒ}| |¡ q(tˆ ƒt|ƒ }t	|ƒD ] }|t|ƒ }||  d7  < qŠ|}t|ƒD ]"\}}	|	dkr¸t
 d|› d¡ q¸t|ƒtˆ ƒkrôtdƒ‚tt|ƒ|d ¡ ‰‡ ‡fd	d
„tt|ƒ|ƒD ƒS )av  
    Randomly split a dataset into non-overlapping new datasets of given lengths.

    If a list of fractions that sum up to 1 is given,
    the lengths will be computed automatically as
    floor(frac * len(dataset)) for each fraction provided.

    After computing the lengths, if there are any remainders, 1 count will be
    distributed in round-robin fashion to the lengths
    until there are no remainders left.

    Optionally fix the generator for reproducible results, e.g.:

    >>> random_split(range(10), [3, 7], generator=torch.Generator().manual_seed(42))
    >>> random_split(range(30), [0.3, 0.3, 0.4], generator=torch.Generator(
    ...   ).manual_seed(42))

    Args:
        dataset (Dataset): Dataset to be split
        lengths (sequence): lengths or fractions of splits to be produced
        generator (Generator): Generator used for the random permutation.
    rO   r   zFraction at index z is not between 0 and 1zLength of split at index z- is 0. This might result in an empty dataset.zDSum of input lengths does not equal the length of the input dataset!)rg   c                    s&   g | ]\}}t ˆ ˆ|| |… ƒ‘qS r#   )r   )r2   ÚoffsetÚlengthrc   r#   r$   re   ^  s     z random_split.<locals>.<listcomp>)ÚmathÚiscloseÚsumÚ	enumeraterP   rZ   Úfloorr?   r@   ÚrangerV   rW   r   ÚtolistÚzipr   )
ra   rf   rg   Zsubset_lengthsrd   ÚfracZn_items_in_splitÚ	remainderZidx_to_add_atri   r#   rc   r$   r   -  s*    ÿ)!rQ   rV   rj   Útypingr   r   r   r   r   r   r   r	   r
   Ztorchr   r   Ztorch._utilsr   Ú r   r   Ú__all__r   r   r   r   r   r   r   r   rZ   Úfloatr   r#   r#   r#   r$   Ú<module>   s6   ,ù
s2ÿ 
ÿ