sdkagent

transformers API reference

400 public APIs from transformers (huggingface/transformers) — 229 classes, 63 functions, 108 methods. Signatures extracted by static analysis of the actual source.

Repository: huggingface/transformers

KindCount
Classes229
Functions63
Methods108

API list

classbenchmark_v2.framework.benchmark_config.BenchmarkConfig
Configuration for a single benchmark scenario.
methodbenchmark_v2.framework.benchmark_runner.BenchmarkRunner.save_results(model_name:str, results:dict, timestamp:str='', summarized:bool=True) -> str
Save benchmark results to JSON file.
funcbenchmark_v2.framework.benchmark_runner.flush_memory(flush_compile:bool=True) -> None
Flush GPU memory and run garbage collection.
classbenchmark_v2.framework.data_classes.BenchmarkMetadata
Metadata collected for each benchmark run.
classbenchmark_v2.framework.data_classes.BenchmarkResult
Result from a series of benchmark runs.
classbenchmark_v2.framework.hardware_metrics.GPUMonitoringStatus
Status of GPU monitoring.
classbenchmark_v2.framework.hardware_metrics.GPURawMetrics
Raw values for GPU utilization and memory used.
classbenchmark_v2.framework.hardware_metrics.HardwareInfo
A class to hold information about the hardware.
funcbenchmark_v2.framework.hardware_metrics.get_amd_gpu_stats(device_handle) -> tuple[int, float]
Get AMD GPU stats using amdsmi library.
classsrc.transformers.activations.LinearActivation
Applies the linear activation function, i.e.
funcsrc.transformers.audio_utils.get_audio_filetype(data:bytes) -> str
Identify a file's container/codec from its magic bytes.
funcsrc.transformers.audio_utils.hertz_to_mel(freq:float | np.ndarray, mel_scale:str='htk') -> float | np.ndarray
Convert frequency from hertz to mels.
funcsrc.transformers.audio_utils.load_audio(audio:str | np.ndarray, sampling_rate=16000, timeout=None, backend:str='auto') -> np.ndarray
Loads `audio` to an np.ndarray object.
funcsrc.transformers.audio_utils.load_audio_librosa(audio:str | np.ndarray, sampling_rate=16000, timeout=None) -> np.ndarray
Deprecated.
funcsrc.transformers.audio_utils.load_audio_torchcodec(audio:str | np.ndarray, sampling_rate=16000, timeout=None) -> np.ndarray
Deprecated.
funcsrc.transformers.audio_utils.make_list_of_audio(audio:list[AudioInput] | AudioInput) -> AudioInput
Ensure that the output is a list of audio.
funcsrc.transformers.audio_utils.make_list_of_audio_chat_template(audio:list[AudioInput] | AudioInput | str | list[str]) -> AudioInput
Ensure that the output is a list of audio.
funcsrc.transformers.audio_utils.mel_to_hertz(mels:float | np.ndarray, mel_scale:str='htk') -> float | np.ndarray
Convert frequency from mels to hertz.
funcsrc.transformers.audio_utils.optimal_fft_length(window_length:int) -> int
Finds the best FFT input size for a given `window_length`.
methodsrc.transformers.cache_utils.Cache.batch_repeat_interleave(repeats:int)
Repeat and interleave the cache
methodsrc.transformers.cache_utils.Cache.batch_select_indices(indices:torch.Tensor)
Select indices from the cache
methodsrc.transformers.cache_utils.Cache.crop(tokens_to_remove:int) -> None
Remove `tokens_to_remove` tokens from the current Cache.
methodsrc.transformers.cache_utils.Cache.get_max_length(layer_idx:int | None=None) -> int
Returns the maximum length of the cache.
methodsrc.transformers.cache_utils.Cache.get_seq_length(layer_idx:int=0) -> int
Returns the sequence length of the cache for the given layer.
methodsrc.transformers.cache_utils.Cache.is_compileable() -> bool
Return whether the cache is compilable
methodsrc.transformers.cache_utils.Cache.is_initialized() -> bool
Return whether the cache data is initialized
methodsrc.transformers.cache_utils.Cache.offload(layer_idx:int, only_non_sliding:bool=True)
Offload a given `layer_idx`.
methodsrc.transformers.cache_utils.Cache.reorder_cache(beam_idx:torch.LongTensor)
Reorder the cache for beam search
methodsrc.transformers.cache_utils.Cache.update_indexer(indexer_key_states:torch.Tensor, layer_idx:int) -> torch.Tensor
Updates the indexer key cache for layer `layer_idx`.
classsrc.transformers.cache_utils.CacheLayerMixin
Base, abstract class for a single layer's cache.
methodsrc.transformers.cache_utils.CacheLayerMixin.get_max_length() -> int
Returns the maximum sequence length the layer can hold.
methodsrc.transformers.cache_utils.CacheLayerMixin.reorder_cache(beam_idx:torch.LongTensor) -> None
Reorders this layer's cache for beam search.
methodsrc.transformers.cache_utils.CacheLayerMixin.reset() -> None
Resets the cache values while preserving the objects
classsrc.transformers.cache_utils.EncoderDecoderCache
Base, abstract class for all encoder-decoder caches.
methodsrc.transformers.cache_utils.EncoderDecoderCache.get_max_length(layer_idx:int | None=None) -> int
Returns the maximum sequence length (i.e.
methodsrc.transformers.cache_utils.EncoderDecoderCache.get_seq_length(layer_idx:int=0) -> int
Returns the sequence length of the cached states.
classsrc.transformers.cli.add_new_model_like.ClassFinder
A visitor to find all classes in a python module.
methodsrc.transformers.cli.add_new_model_like.ClassFinder.visit_ClassDef(node:cst.ClassDef) -> None
Record class names.
funcsrc.transformers.cli.add_new_model_like.convert_to_bool(x:str) -> bool
Converts a string to a bool.
classsrc.transformers.cli.chat.Chat
Chat with a model from the command line.
funcsrc.transformers.cli.chat.get_username() -> str
Returns the username of the current user.
funcsrc.transformers.cli.chat.new_chat_history(system_prompt:str | None=None) -> list[dict]
Returns a new chat conversation.
funcsrc.transformers.cli.chat.save_chat(filename:str, chat:list[dict], settings:dict) -> str
Saves the chat history to a file.
classsrc.transformers.cli.serving.completion.CompletionHandler
Handler for the `/v1/completions` endpoint.
methodsrc.transformers.cli.serving.model_manager.ModelManager.process_model_name(model_id:str) -> str
Canonicalize to `'model_id@revision'` format.
methodsrc.transformers.cli.serving.model_manager.ModelManager.shutdown() -> None
Delete all loaded models and free resources.
classsrc.transformers.cli.serving.response.ResponseHandler
Handler for the ``/v1/responses`` endpoint.
classsrc.transformers.cli.serving.transcription.TranscriptionHandler
Handler for ``POST /v1/audio/transcriptions``.
classsrc.transformers.cli.serving.utils.BaseGenerateManager
Base class for generation managers.
methodsrc.transformers.cli.serving.utils.BaseGenerateManager.init_cb(model:'PreTrainedModel', gen_config:'GenerationConfig') -> None
Initialize continuous batching.
methodsrc.transformers.cli.serving.utils.BaseGenerateManager.stop() -> None
Stop the generation manager and free resources.
classsrc.transformers.cli.serving.utils.BaseHandler
Shared logic for chat completion and responses handlers.
classsrc.transformers.cli.serving.utils.CBGenerateManager
Continuous batching generation via paged attention.
methodsrc.transformers.cli.serving.utils.CBGenerateManager.is_alive() -> bool
Whether the CB worker is healthy.
methodsrc.transformers.cli.serving.utils.CBGenerateManager.scheduler() -> 'Scheduler'
The CB scheduler (for testing/monitoring).
classsrc.transformers.cli.serving.utils.GenerationState
Shared generation state across all handlers.
methodsrc.transformers.cli.serving.utils.GenerationState.is_cb_alive() -> bool
Whether the CB worker is healthy.
methodsrc.transformers.cli.serving.utils.GenerationState.shutdown() -> None
Stop any active generation managers.
classsrc.transformers.cli.serving.utils.InferenceThread
Persistent thread for ``model.generate()`` calls.
methodsrc.transformers.cli.serving.utils.InferenceThread.submit(fn, *args, **kwargs) -> Future
Submit a callable to the inference thread.
funcsrc.transformers.cli.serving.utils.reset_torch_cache() -> None
Empty the CUDA cache if a GPU is available.
funcsrc.transformers.cli.serving.utils.set_torch_seed(seed:int) -> None
Set the PyTorch random seed for reproducible generation.
funcsrc.transformers.cli.system.version() -> None
Print CLI version.
classsrc.transformers.configuration_utils.PreTrainedConfig
Base class for all configuration classes.
methodsrc.transformers.configuration_utils.PreTrainedConfig.to_json_string(use_diff:bool=True) -> str
Serializes this instance to a JSON string.
funcsrc.transformers.configuration_utils.remap_legacy_layer_types(layer_types:list[str]) -> list[str]
Apply legacy → current layer-type name mapping.
classsrc.transformers.convert_slow_tokenizer.TikTokenConverter
A general tiktoken converter.
classsrc.transformers.core_model_loading.Chunk
Split a tensor along `dim` into equally sized chunks.
classsrc.transformers.core_model_loading.Concatenate
Concatenate tensors along `dim`.
classsrc.transformers.core_model_loading.Conv3dToLinear
Conv3d weights → flattened Linear layout.
classsrc.transformers.core_model_loading.ConversionOps
Base class for weight conversion operations.
classsrc.transformers.core_model_loading.LinearToConv3d
Flattened Linear weights → Conv3d layout.
classsrc.transformers.core_model_loading.Transpose
Transposes the given tensor along dim0 and dim1.
classsrc.transformers.data.data_collator.DataCollatorForLanguageModeling
Data collator used for language modeling.
classsrc.transformers.data.data_collator.DataCollatorWithFlattening
Data collator used for padding free approach.
classsrc.transformers.data.processors.glue.ColaProcessor
Processor for the CoLA data set (GLUE version).
methodsrc.transformers.data.processors.glue.ColaProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.ColaProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.ColaProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.ColaProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.ColaProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.MnliProcessor
Processor for the MultiNLI data set (GLUE version).
methodsrc.transformers.data.processors.glue.MnliProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.MnliProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.MnliProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.MnliProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.MnliProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.MrpcProcessor
Processor for the MRPC data set (GLUE version).
methodsrc.transformers.data.processors.glue.MrpcProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.MrpcProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.MrpcProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.MrpcProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.MrpcProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.QnliProcessor
Processor for the QNLI data set (GLUE version).
methodsrc.transformers.data.processors.glue.QnliProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.QnliProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.QnliProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.QnliProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.QnliProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.QqpProcessor
Processor for the QQP data set (GLUE version).
methodsrc.transformers.data.processors.glue.QqpProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.QqpProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.QqpProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.QqpProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.QqpProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.RteProcessor
Processor for the RTE data set (GLUE version).
methodsrc.transformers.data.processors.glue.RteProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.RteProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.RteProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.RteProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.RteProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.Sst2Processor
Processor for the SST-2 data set (GLUE version).
methodsrc.transformers.data.processors.glue.Sst2Processor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.Sst2Processor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.Sst2Processor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.Sst2Processor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.Sst2Processor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.StsbProcessor
Processor for the STS-B data set (GLUE version).
methodsrc.transformers.data.processors.glue.StsbProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.StsbProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.StsbProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.StsbProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.StsbProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.glue.WnliProcessor
Processor for the WNLI data set (GLUE version).
methodsrc.transformers.data.processors.glue.WnliProcessor.get_dev_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.WnliProcessor.get_example_from_tensor_dict(tensor_dict)
See base class.
methodsrc.transformers.data.processors.glue.WnliProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.glue.WnliProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.glue.WnliProcessor.get_train_examples(data_dir)
See base class.
classsrc.transformers.data.processors.squad.SquadFeatures
Single squad example features to be fed to a model.
classsrc.transformers.data.processors.squad.SquadProcessor
Processor for the SQuAD data set.
classsrc.transformers.data.processors.utils.InputExample
A single training/test example for simple sequence classification.
classsrc.transformers.data.processors.utils.InputFeatures
A single set of features of data.
classsrc.transformers.data.processors.xnli.XnliProcessor
Processor for the XNLI dataset.
methodsrc.transformers.data.processors.xnli.XnliProcessor.get_labels()
See base class.
methodsrc.transformers.data.processors.xnli.XnliProcessor.get_test_examples(data_dir)
See base class.
methodsrc.transformers.data.processors.xnli.XnliProcessor.get_train_examples(data_dir)
See base class.
funcsrc.transformers.distributed.fsdp.apply_fully_sharded_data_parallelism(model:nn.Module, fsdp_mesh:torch.distributed.device_mesh.DeviceMesh) -> nn.Module
Apply FSDP2 (fully_shard) to a model.
funcsrc.transformers.distributed.fsdp.is_fsdp_managed_module(module:nn.Module) -> bool
Check if a module is managed by FSDP (1 or 2).
funcsrc.transformers.distributed.utils.load_optimizer_distributed(model, optimizer, checkpoint_dir:str) -> None
Load optimizer state via DCP.
funcsrc.transformers.distributed.utils.save_optimizer_distributed(model, optimizer, checkpoint_dir:str) -> None
Save optimizer state via DCP.
classsrc.transformers.exporters.base.HfExporter
Abstract base class for all Transformers exporters.
classsrc.transformers.exporters.configs.ExportFormat
Identifies the export backend.
funcsrc.transformers.exporters.exporter_dynamo.get_auto_dynamic_shapes(inputs:Any) -> Any
Recursively build dynamic shapes for any input value.
funcsrc.transformers.exporters.exporter_dynamo.register_pytree_node(object_cls:type)
Register a single class (e.g.
funcsrc.transformers.exporters.exporter_executorch.prepare_for_xnnpack(model:PreTrainedModel, sample_inputs:dict[str, Any])
CPU inference via XNNPACK.
funcsrc.transformers.exporters.utils.module_device(model:PreTrainedModel | torch.nn.Module) -> torch.device | None
`.device` for any `nn.Module`.
funcsrc.transformers.exporters.utils.module_dtype(model:PreTrainedModel | torch.nn.Module) -> torch.dtype | None
`.dtype` for any `nn.Module`.
funcsrc.transformers.exporters.utils.register_export_input_preparer(*markers:str)
Register `fn(model, inputs) -> None`.
classsrc.transformers.fusion_mapping.ModuleFusionSpec
Base recipe for a fusion family.
classsrc.transformers.generation.configuration_utils.BaseWatermarkingConfig
Generic watermarking config
methodsrc.transformers.generation.configuration_utils.GenerationConfig.to_json_file(json_file_path:str | os.PathLike, use_diff:bool=True, keys_to_pop:list[str] | None=None) -> None
Save this instance to a JSON file.
funcsrc.transformers.generation.continuous_batching.cache.find_head_dim(config:PreTrainedConfig) -> int
Finds the head dimension for the given config.
methodsrc.transformers.generation.continuous_batching.cache_manager.BlockManager.free_blocks(blocks:list[int], shareable:bool) -> None
Marks a list of (blocks) as free.
methodsrc.transformers.generation.continuous_batching.cache_manager.BlockManager.uninitialize_unshared_block(block_id:int) -> None
Marks a block as uninitialized.
classsrc.transformers.generation.continuous_batching.cache_manager.CacheAllocator
Abstract base class for cache managers.
classsrc.transformers.generation.continuous_batching.requests.GenerationOutput
Tracks the output of a generation request.
classsrc.transformers.generation.logits_process.MinPLogitsWarper
[`LogitsProcessor`] that performs min-p, i.e.
classsrc.transformers.generation.logits_process.SynthIDTextWatermarkState
SynthID watermarking state.
classsrc.transformers.generation.logits_process.TopKLogitsWarper
[`LogitsProcessor`] that performs top-k, i.e.
classsrc.transformers.generation.logits_process.TopPLogitsWarper
[`LogitsProcessor`] that performs top-p, i.e.
classsrc.transformers.generation.streamers.TextDiffusionStreamer
Streamer that prints text diffusion outputs.
methodsrc.transformers.generation.streamers.TextStreamer.on_finalized_text(text:str, stream_end:bool=False)
Prints the new text to stdout.
classsrc.transformers.generation.watermarking.BayesianDetectorModel
Bayesian classifier for watermark detection.
classsrc.transformers.generation.watermarking.SynthIDTextWatermarkDetector
SynthID text watermark detector class.
classsrc.transformers.generation.watermarking.WatermarkDetectorOutput
Outputs of a watermark detector.
methodsrc.transformers.image_processing_backends.PilBackend.center_crop(image:np.ndarray, size:SizeDict, **kwargs) -> np.ndarray
Center crop an image using NumPy.
methodsrc.transformers.image_processing_backends.PilBackend.convert_to_rgb(image:ImageInput) -> ImageInput
Convert an image to RGB format.
methodsrc.transformers.image_processing_backends.PilBackend.normalize(image:np.ndarray, mean:float | Iterable[float], std:float | Iterable[float], **kwargs) -> np.ndarray
Normalize an image using NumPy.
methodsrc.transformers.image_processing_backends.PilBackend.rescale(image:np.ndarray, scale:float, **kwargs) -> np.ndarray
Rescale an image by a scale factor using NumPy.
methodsrc.transformers.image_processing_backends.PilBackend.resize(image:np.ndarray, size:SizeDict, resample:'PILImageResampling | None'=None, reducing_gap:int | None=None, **kwargs) -> np.ndarray
Resize an image using PIL/NumPy.
funcsrc.transformers.image_transforms.convert_to_rgb(image:ImageInput) -> ImageInput
Converts an image to RGB format.
funcsrc.transformers.image_transforms.group_images_by_shape(images:Union[list['torch.Tensor'], 'torch.Tensor'], *disable_grouping:bool | None, *is_nested:bool=False, *paired_inputs) -> tuple[dict, ...]
Groups images by shape.
funcsrc.transformers.image_transforms.id_to_rgb(id_map)
Converts unique ID to RGB color.
funcsrc.transformers.image_transforms.rescale(image:np.ndarray, scale:float, data_format:ChannelDimension | None=None, dtype:np.dtype=np.float32, input_data_format:str | ChannelDimension | None=None) -> np.ndarray
Rescales `image` by `scale`.
funcsrc.transformers.image_transforms.rgb_to_id(color)
Converts RGB color to unique ID.
classsrc.transformers.image_utils.SizeDict
Hashable dictionary to store image size information.
funcsrc.transformers.image_utils.infer_channel_dimension_format(image:np.ndarray, num_channels:int | tuple[int, ...] | None=None) -> ChannelDimension
Infers the channel dimension format of `image`.
funcsrc.transformers.image_utils.load_image(image:Union[str, 'PIL.Image.Image'], timeout:float | None=None) -> 'PIL.Image.Image'
Loads `image` to a PIL Image.
funcsrc.transformers.image_utils.make_flat_list_of_images(images:list[ImageInput] | ImageInput, expected_ndims:int=3) -> ImageInput
Ensure that the output is a flat list of images.
funcsrc.transformers.image_utils.make_list_of_images(images, expected_ndims:int=3) -> list[ImageInput]
Ensure that the output is a list of images.
classsrc.transformers.integrations.finegrained_fp8.FP8GroupedLinear
FP8 drop-in for block-diagonal grouped linears.
classsrc.transformers.integrations.integration_utils.WandbLogModel
Enum of possible log model values in W&B.
funcsrc.transformers.integrations.integration_utils.default_logdir() -> str
Same default as PyTorch
classsrc.transformers.integrations.sinq.SinqQuantize
Param-level ConversionOp for SINQ (from FP weights).
classsrc.transformers.integrations.tensor_parallel.MoeTensorParalellMegaMoeExperts
TP layer for DeepGEMM Mega MoE experts.
classsrc.transformers.integrations.tensor_parallel.RouterParallelMegaMoe
Router TP plan used with DeepGEMM Mega MoE.
classsrc.transformers.integrations.tensor_parallel.TensorParallelLayer
General tensor parallel layer for transformers
funcsrc.transformers.integrations.tensor_parallel.split(x, device_mesh)
Split forward, all-gather backward.
classsrc.transformers.loss.loss_d_fine.DFineLoss
This class computes the losses for D-FINE.
classsrc.transformers.loss.loss_rt_detr.RTDetrLoss
This class computes the losses for RTDetr.
funcsrc.transformers.masking_utils.bidirectional_mask_function(batch_idx:int, head_idx:int, q_idx:int, kv_idx:int) -> bool
This creates a full bidirectional mask.
funcsrc.transformers.masking_utils.causal_mask_function(batch_idx:int, head_idx:int, q_idx:int, kv_idx:int) -> bool
This creates a basic lower-diagonal causal mask.
funcsrc.transformers.masking_utils.sliding_window_overlay(sliding_window:int) -> Callable
This is an overlay depicting a sliding window pattern.
classsrc.transformers.modeling_layers.GradientCheckpointingLayer
Base class for layers with gradient checkpointing.
classsrc.transformers.modeling_outputs.BackboneOutput
Base class for outputs of backbones.
classsrc.transformers.modeling_outputs.DepthEstimatorOutput
Base class for outputs of depth estimation models.
classsrc.transformers.modeling_outputs.MaskedLMOutput
Base class for masked language models outputs.
classsrc.transformers.modeling_outputs.MultipleChoiceModelOutput
Base class for outputs of multiple choice models.
classsrc.transformers.modeling_outputs.XVectorOutput
Output type of [`Wav2Vec2ForXVector`].
classsrc.transformers.modeling_utils.LoadStateDictConfig
Config for loading weights.
classsrc.transformers.modeling_utils.PreTrainedModel
Base class for all models.
methodsrc.transformers.modeling_utils.PreTrainedModel.base_model() -> nn.Module
`torch.nn.Module`: The main body of the model.
methodsrc.transformers.modeling_utils.PreTrainedModel.set_decoder(decoder)
Symmetric setter.
methodsrc.transformers.modeling_utils.PreTrainedModel.set_encoder(encoder, modality:str | None=None)
Symmetric setter.
methodsrc.transformers.modeling_utils.PreTrainedModel.tie_weights(missing_keys:set[str] | None=None, recompute_mapping:bool=True)
Tie the model weights.
funcsrc.transformers.modeling_utils.is_accelerator_device(device:str | int | torch.device) -> bool
Check if the device is an accelerator.
classsrc.transformers.models.afmoe.modeling_afmoe.AfmoeDecoderLayer
AFMoE decoder layer with dual normalization.
classsrc.transformers.models.afmoe.modeling_afmoe.AfmoeExperts
Collection of expert weights stored as 3D tensors.
classsrc.transformers.models.afmoe.modeling_afmoe.AfmoeSparseMoeBlock
Mixture of Experts (MoE) module for AFMoE.
classsrc.transformers.models.afmoe.modeling_afmoe.AfmoeTokenChoiceRouter
Token-choice top-K router for MoE routing.
classsrc.transformers.models.afmoe.modular_afmoe.AfmoeDecoderLayer
AFMoE decoder layer with dual normalization.
classsrc.transformers.models.afmoe.modular_afmoe.AfmoeSparseMoeBlock
Mixture of Experts (MoE) module for AFMoE.
classsrc.transformers.models.afmoe.modular_afmoe.AfmoeTokenChoiceRouter
Token-choice top-K router for MoE routing.
classsrc.transformers.models.aria.modeling_aria.AriaCrossAttention
Aria Cross-Attention module.
classsrc.transformers.models.aria.modeling_aria.AriaProjector
Aria Projector module.
classsrc.transformers.models.aria.modeling_aria.AriaProjectorMLP
Feed-Forward Network module for the Aria Projector.
classsrc.transformers.models.aria.modeling_aria.AriaSharedExpertsMLP
Shared Expert MLP for shared experts.
classsrc.transformers.models.aria.modeling_aria.AriaTextDecoderLayer
Aria Text Decoder Layer.
classsrc.transformers.models.aria.modular_aria.AriaCrossAttention
Aria Cross-Attention module.
classsrc.transformers.models.aria.modular_aria.AriaProjector
Aria Projector module.
classsrc.transformers.models.aria.modular_aria.AriaSharedExpertsMLP
Shared Expert MLP for shared experts.
classsrc.transformers.models.aria.modular_aria.AriaTextDecoderLayer
Aria Text Decoder Layer.
classsrc.transformers.models.autoformer.modeling_autoformer.AutoformerFeatureEmbedder
Embed a sequence of categorical features.
classsrc.transformers.models.axk1.modeling_axk1.AXK1Experts
Collection of expert weights stored as 3D tensors.
classsrc.transformers.models.axk2.modeling_axk2.AXK2Experts
Collection of expert weights stored as 3D tensors.
classsrc.transformers.models.axk2.modeling_axk2.AXK2MoE
A mixed expert module containing shared experts.
classsrc.transformers.models.bark.modeling_bark.BarkSelfFlashAttention2
Bark flash attention module.
classsrc.transformers.models.bart.modeling_bart.BartClassificationHead
Head for sentence-level classification tasks.
classsrc.transformers.models.bartpho.tokenization_bartpho.BartphoTokenizer
Adapted from [`XLMRobertaTokenizer`].
classsrc.transformers.models.beit.modeling_beit.BeitFPNNeck
4-level feature pyramid neck for BeiT.
classsrc.transformers.models.beit.modeling_beit.BeitPyramidPoolingModule
Pyramid Pooling Module (PPM) used in PSPNet.
classsrc.transformers.models.beit.modular_beit.BeitFPNNeck
4-level feature pyramid neck for BeiT.
classsrc.transformers.models.beit.modular_beit.BeitPyramidPoolingModule
Pyramid Pooling Module (PPM) used in PSPNet.
classsrc.transformers.models.beit.modular_beit.BeitUperHead
Unified Perceptual Parsing for Scene Understanding.
classsrc.transformers.models.bert.tokenization_bert_legacy.BertTokenizerLegacy
Construct a BERT tokenizer.
classsrc.transformers.models.bert.tokenization_bert_legacy.WordpieceTokenizer
Runs WordPiece tokenization.
classsrc.transformers.models.bert_generation.tokenization_bert_generation.BertGenerationTokenizer
Construct a BertGeneration tokenizer.
classsrc.transformers.models.bert_japanese.tokenization_bert_japanese.CharacterTokenizer
Runs Character tokenization.
classsrc.transformers.models.bert_japanese.tokenization_bert_japanese.SentencepieceTokenizer
Runs sentencepiece tokenization.
classsrc.transformers.models.bert_japanese.tokenization_bert_japanese.WordpieceTokenizer
Runs WordPiece tokenization.
classsrc.transformers.models.big_bird.modeling_big_bird.BigBirdForQuestionAnsweringHead
Head for question answering tasks.
classsrc.transformers.models.biogpt.tokenization_biogpt.BioGptTokenizer
Construct an FAIRSEQ Transformer tokenizer.
methodsrc.transformers.models.biogpt.tokenization_biogpt.BioGptTokenizer.vocab_size()
Returns vocab size
classsrc.transformers.models.bit.modeling_bit.BitPreActivationBottleneckLayer
Pre-activation (v2) bottleneck block.
classsrc.transformers.models.bit.modeling_bit.BitStage
A ResNet v2 stage composed by stacked layers.
classsrc.transformers.models.bit.modeling_bit.WeightStandardizedConv2d
Conv2d with Weight Standardization.
funcsrc.transformers.models.bloom.modeling_bloom.bloom_gelu_forward(x:torch.Tensor) -> torch.Tensor
Custom bias GELU function.
classsrc.transformers.models.byt5.tokenization_byt5.ByT5Tokenizer
Construct a ByT5 tokenizer.
classsrc.transformers.models.camembert.modeling_camembert.CamembertLMHead
Camembert Head for masked language modeling.
classsrc.transformers.models.canine.tokenization_canine.CanineTokenizer
Construct a CANINE tokenizer (i.e.
funcsrc.transformers.models.chmv2.convert_chmv2_to_hf.get_chmv2_config(model_name:str, backbone_repo_id:str | None=None) -> CHMv2Config
Create CHMv2 config based on model name.
classsrc.transformers.models.chmv2.modeling_chmv2.CHMv2Head
CHMv2 dense-prediction head adapted from DPT.
classsrc.transformers.models.chmv2.modeling_chmv2.CHMv2PreActResidualLayer
ResidualConvUnit, pre-activate residual unit.
classsrc.transformers.models.chmv2.modeling_chmv2.CHMv2UpsampleConvHead
Convolutional head with intermediate upsampling.
classsrc.transformers.models.chmv2.modular_chmv2.CHMv2Head
CHMv2 dense-prediction head adapted from DPT.
classsrc.transformers.models.clap.feature_extraction_clap.ClapFeatureExtractor
Constructs a CLAP feature extractor.
classsrc.transformers.models.clap.modeling_clap.ClapAudioPatchMerging
Patch Merging Layer.
funcsrc.transformers.models.clap.modeling_clap.interpolate(hidden_states, ratio)
Interpolate data in time domain.
classsrc.transformers.models.clvp.feature_extraction_clvp.ClvpFeatureExtractor
Constructs a CLVP feature extractor.
classsrc.transformers.models.clvp.modeling_clvp.ClvpRotaryPositionalEmbedding
Rotary Position Embedding Class for CLVP.
classsrc.transformers.models.clvp.tokenization_clvp.ClvpTokenizer
Construct a CLVP tokenizer.
classsrc.transformers.models.code_llama.tokenization_code_llama.CodeLlamaTokenizer
Construct a Llama tokenizer.
classsrc.transformers.models.cohere.tokenization_cohere.CohereTokenizer
Construct a Cohere tokenizer.
classsrc.transformers.models.convnextv2.modeling_convnextv2.ConvNextV2GRN
GRN (Global Response Normalization) layer
classsrc.transformers.models.cpmant.tokenization_cpmant.CpmAntTokenizer
Construct a CPMAnt tokenizer.
classsrc.transformers.models.csm.generation_csm.CsmGenerateOutput
Outputs of CsmForConditionalGeneration.generate.
classsrc.transformers.models.ctrl.tokenization_ctrl.CTRLTokenizer
Construct a CTRL tokenizer.
classsrc.transformers.models.cvt.modeling_cvt.CvtConvEmbeddings
Image to Conv Embedding.
classsrc.transformers.models.cvt.modeling_cvt.CvtEmbeddings
Construct the CvT embeddings.
classsrc.transformers.models.dac.feature_extraction_dac.DacFeatureExtractor
Constructs an Dac feature extractor.
classsrc.transformers.models.dac.modeling_dac.DacDecoder
DAC Decoder
classsrc.transformers.models.dac.modeling_dac.DacDecoderBlock
Decoder block used in DAC decoder.
classsrc.transformers.models.dac.modeling_dac.DacEncoder
DAC Encoder
classsrc.transformers.models.dac.modeling_dac.DacEncoderBlock
Encoder block used in DAC encoder.
classsrc.transformers.models.dac.modeling_dac.Snake1d
A 1-dimensional Snake activation function module.
classsrc.transformers.models.dbrx.modeling_dbrx.DbrxFFN
Modular DBRX MLP/FFN component with MoE support.
classsrc.transformers.models.dbrx.modular_dbrx.DbrxFFN
Modular DBRX MLP/FFN component with MoE support.
classsrc.transformers.models.deepseek_ocr2.modeling_deepseek_ocr2.DeepseekOcr2VisionModel
Vision pipeline: SAM ViT-B (with neck)
classsrc.transformers.models.deepseek_ocr2.modular_deepseek_ocr2.DeepseekOcr2VisionModel
Vision pipeline: SAM ViT-B (with neck)
classsrc.transformers.models.deepseek_v4.modeling_deepseek_v4.DeepseekV4CSACache
Cache layer for CSA blocks (paper §2.3.1).
classsrc.transformers.models.deepseek_v4.modeling_deepseek_v4.DeepseekV4DecoderLayer
DeepSeek-V4 decoder block (paper §2).
classsrc.transformers.models.deepseek_v4.modeling_deepseek_v4.DeepseekV4HCACache
Cache layer for HCA blocks (paper §2.3.2).
classsrc.transformers.models.deepseek_v4.modeling_deepseek_v4.DeepseekV4Indexer
Lightning Indexer (paper §2.3.1, eqs.
classsrc.transformers.models.deepseek_v4.modular_deepseek_v4.DeepseekV4CSACache
Cache layer for CSA blocks (paper §2.3.1).
classsrc.transformers.models.deepseek_v4.modular_deepseek_v4.DeepseekV4DecoderLayer
DeepSeek-V4 decoder block (paper §2).
classsrc.transformers.models.deepseek_v4.modular_deepseek_v4.DeepseekV4HCACache
Cache layer for HCA blocks (paper §2.3.2).
classsrc.transformers.models.deepseek_v4.modular_deepseek_v4.DeepseekV4Indexer
Lightning Indexer (paper §2.3.1, eqs.
classsrc.transformers.models.deimv2.modeling_deimv2.Deimv2HybridEncoder
DEIMv2 variant of DFineHybridEncoder.
classsrc.transformers.models.deimv2.modular_deimv2.Deimv2HybridEncoder
DEIMv2 variant of DFineHybridEncoder.
classsrc.transformers.models.depth_anything.modeling_depth_anything.DepthAnythingNeck
DepthAnythingNeck.
funcsrc.transformers.models.depth_pro.modeling_depth_pro.split_to_patches(pixel_values:torch.Tensor, patch_size:int, overlap_ratio:float) -> torch.Tensor
Creates Patches from Batch.
funcsrc.transformers.models.detr.image_processing_pil_detr.convert_coco_poly_to_mask(segmentations, height:int, width:int) -> np.ndarray
Convert a COCO polygon annotation to a mask.
classsrc.transformers.models.dia.feature_extraction_dia.DiaFeatureExtractor
Constructs an Dia feature extractor.
classsrc.transformers.models.dia.modeling_dia.DiaDecoder
Transformer Decoder Stack using DenseGeneral.
classsrc.transformers.models.dia.modular_dia.DiaDecoder
Transformer Decoder Stack using DenseGeneral.
classsrc.transformers.models.dia.tokenization_dia.DiaTokenizer
Construct a Dia tokenizer.
classsrc.transformers.models.diffusion_gemma.modeling_diffusion_gemma.DiffusionGemmaDecoderModel
Decoder model for DiffusionGemma.
classsrc.transformers.models.diffusion_gemma.modular_diffusion_gemma.DiffusionGemmaDecoderModel
Decoder model for DiffusionGemma.
classsrc.transformers.models.dinat.modeling_dinat.DinatDownsampler
Convolutional Downsampling Layer.
classsrc.transformers.models.dinat.modeling_dinat.DinatEmbeddings
Construct the patch and position embeddings.
classsrc.transformers.models.donut.modeling_donut_swin.DonutSwinEmbeddings
Construct the patch and position embeddings.
classsrc.transformers.models.donut.modeling_donut_swin.DonutSwinPatchMerging
Patch Merging Layer.
classsrc.transformers.models.dots1.modeling_dots1.Dots1Experts
Collection of expert weights stored as 3D tensors.
classsrc.transformers.models.dots1.modeling_dots1.Dots1MoE
A mixed expert module containing shared experts.
classsrc.transformers.models.dpr.tokenization_dpr.DPRContextEncoderTokenizer
Construct a DPRContextEncoder tokenizer.
classsrc.transformers.models.dpr.tokenization_dpr.DPRQuestionEncoderTokenizer
Constructs a DPRQuestionEncoder tokenizer.
classsrc.transformers.models.dpr.tokenization_dpr.DPRReaderTokenizer
Construct a DPRReader tokenizer.
classsrc.transformers.models.dpt.image_processing_dpt.DPTImageProcessor
PIL backend for DPT with reduce_label support.
classsrc.transformers.models.dpt.modeling_dpt.DPTNeck
DPTNeck.
classsrc.transformers.models.dpt.modeling_dpt.DPTPreActResidualLayer
ResidualConvUnit, pre-activate residual unit.
classsrc.transformers.models.dpt.modeling_dpt.DPTViTPatchEmbeddings
Image to Patch Embedding.
classsrc.transformers.models.encodec.feature_extraction_encodec.EncodecFeatureExtractor
Constructs an EnCodec feature extractor.
classsrc.transformers.models.encodec.modeling_encodec.EncodecDecoder
SEANet decoder as used by EnCodec.
classsrc.transformers.models.encodec.modeling_encodec.EncodecEncoder
SEANet encoder as used by EnCodec.
classsrc.transformers.models.encodec.modeling_encodec.EncodecEuclideanCodebook
Codebook with Euclidean distance.
classsrc.transformers.models.encodec.modeling_encodec.EncodecResidualVectorQuantizer
Residual Vector Quantizer.
classsrc.transformers.models.encodec.modeling_encodec.EncodecVectorQuantization
Vector quantization implementation.
funcsrc.transformers.models.eomt.image_processing_eomt.get_target_size(size_dict:dict[str, int]) -> tuple[int, int]
Returns the height and width from a size dict.
funcsrc.transformers.models.eomt.image_processing_pil_eomt.get_target_size(size_dict:dict[str, int]) -> tuple[int, int]
Returns the height and width from a size dict.
classsrc.transformers.models.esm.modeling_esm.EsmClassificationHead
Head for sentence-level classification tasks.
classsrc.transformers.models.esm.modeling_esm.EsmLMHead
ESM Head for masked language modeling.
classsrc.transformers.models.esm.modeling_esm.EsmRotaryEmbedding
Rotary position embeddings.
classsrc.transformers.models.esm.modeling_esmfold.EsmFoldAngleResnet
Implements Algorithm 20, lines 11-14
classsrc.transformers.models.esm.modeling_esmfold.EsmFoldBackboneUpdate
Implements part of Algorithm 23.
classsrc.transformers.models.esm.modeling_esmfold.EsmFoldInvariantPointAttention
Implements Algorithm 22.
classsrc.transformers.models.esm.modeling_esmfold.EsmFoldTriangleMultiplicativeUpdate
Implements Algorithms 11 and 12.
classsrc.transformers.models.esm.modeling_esmfold.EsmForProteinFoldingOutput
frames (`torch.FloatTensor`): Output frames.
classsrc.transformers.models.esm.openfold_utils.protein.Protein
Protein structure representation.
funcsrc.transformers.models.esm.openfold_utils.protein.add_pdb_headers(prot:Protein, pdb_str:str) -> str
Add pdb headers to an existing PDB string.
funcsrc.transformers.models.esm.openfold_utils.protein.ideal_atom_mask(prot:Protein) -> np.ndarray
Computes an ideal atom mask.
funcsrc.transformers.models.esm.openfold_utils.protein.to_pdb(prot:Protein) -> str
Converts a `Protein` instance to a PDB string.
funcsrc.transformers.models.esm.openfold_utils.residue_constants.make_bond_key(atom1_name:str, atom2_name:str) -> str
Unique key to lookup bonds.
classsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid
A class representing a rigid transformation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.apply(pts:torch.Tensor) -> torch.Tensor
Applies the transformation to a coordinate tensor.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.cat(ts:Sequence[Rigid], dim:int) -> Rigid
Concatenates transformations along a new dimension.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.compose(r:Rigid) -> Rigid
Composes the current rigid object with another.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.from_3_points(p_neg_x_axis:torch.Tensor, origin:torch.Tensor, p_xy_plane:torch.Tensor, eps:float=1e-08) -> Rigid
Implements algorithm 21.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.get_rots() -> Rotation
Getter for the rotation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.get_trans() -> torch.Tensor
Getter for the translation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.invert() -> Rigid
Inverts the transformation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.scale_translation(trans_scale_factor:float) -> Rigid
Scales the translation by a constant factor.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rigid.unsqueeze(dim:int) -> Rigid
Analogous to torch.unsqueeze.
classsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation
A 3D rotation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.apply(pts:torch.Tensor) -> torch.Tensor
Apply the current Rotation as a rotation matrix to a set of 3D coordinates.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.cat(rs:Sequence[Rotation], dim:int) -> Rotation
Concatenates rotations along one of the batch dimensions.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.get_rot_mats() -> torch.Tensor
Returns the underlying rotation as a rotation matrix tensor.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.identity(shape, dtype:torch.dtype | None=None, device:torch.device | None=None, requires_grad:bool=True, fmt:str='quat') -> Rotation
Returns an identity Rotation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.invert() -> Rotation
Returns the inverse of the current Rotation.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.invert_apply(pts:torch.Tensor) -> torch.Tensor
The inverse of the apply() method.
methodsrc.transformers.models.esm.openfold_utils.rigid_utils.Rotation.unsqueeze(dim:int) -> Rotation
Analogous to torch.unsqueeze.
funcsrc.transformers.models.esm.openfold_utils.rigid_utils.quat_multiply(quat1:torch.Tensor, quat2:torch.Tensor) -> torch.Tensor
Multiply a quaternion by another quaternion.
funcsrc.transformers.models.esm.openfold_utils.rigid_utils.quat_multiply_by_vec(quat:torch.Tensor, vec:torch.Tensor) -> torch.Tensor
Multiply a quaternion by a pure-vector quaternion.
funcsrc.transformers.models.esm.openfold_utils.rigid_utils.quat_to_rot(quat:torch.Tensor) -> torch.Tensor
Converts a quaternion to a rotation matrix.
funcsrc.transformers.models.esm.openfold_utils.rigid_utils.rot_matmul(a:torch.Tensor, b:torch.Tensor) -> torch.Tensor
Performs matrix multiplication of two rotation matrix tensors.
funcsrc.transformers.models.esm.openfold_utils.rigid_utils.rot_vec_mul(r:torch.Tensor, t:torch.Tensor) -> torch.Tensor
Applies a rotation to a vector.
classsrc.transformers.models.esm.tokenization_esm.EsmTokenizer
Constructs an ESM tokenizer.
classsrc.transformers.models.evolla.modeling_evolla.EvollaSaProtRotaryEmbedding
Rotary position embeddings.
classsrc.transformers.models.falcon.modeling_falcon.FalconFlashAttention2
Falcon flash attention module.
classsrc.transformers.models.fastspeech2_conformer.modeling_fastspeech2_conformer.FastSpeech2ConformerDurationPredictor
Duration predictor module.
classsrc.transformers.models.fastspeech2_conformer.modeling_fastspeech2_conformer.FastSpeech2ConformerModel
FastSpeech 2 module.
classsrc.transformers.models.flaubert.modeling_flaubert.FlaubertSQuADHead
A SQuAD head inspired by XLNet.
classsrc.transformers.models.flaubert.tokenization_flaubert.FlaubertTokenizer
Construct a Flaubert tokenizer.
classsrc.transformers.models.flava.modeling_flava.PatchEmbeddings
Image to Patch Embedding.
classsrc.transformers.models.florence2.modeling_florence2.Florence2VisionConvEmbed
Image to Patch Embedding
classsrc.transformers.models.florence2.modular_florence2.Florence2PostProcessor
Post-processor for Florence-2 model outputs.
methodsrc.transformers.models.florence2.modular_florence2.Florence2PostProcessor.quantize(locations:'torch.Tensor', size:tuple[int, int]) -> 'torch.Tensor'
Quantize locations.
classsrc.transformers.models.florence2.modular_florence2.Florence2VisionConvEmbed
Image to Patch Embedding
methodsrc.transformers.models.florence2.processing_florence2.Florence2PostProcessor.quantize(locations:'torch.Tensor', size:tuple[int, int]) -> 'torch.Tensor'
Quantize locations.
classsrc.transformers.models.fnet.tokenization_fnet.FNetTokenizer
Construct an FNet tokenizer.
classsrc.transformers.models.focalnet.modeling_focalnet.FocalNetEmbeddings
Construct the patch embeddings and layernorm.
classsrc.transformers.models.focalnet.modeling_focalnet.FocalNetLayer
Focal Modulation Network layer (block).
funcsrc.transformers.models.fsmt.modeling_fsmt.make_padding_mask(input_ids, padding_idx=1)
True for pad tokens
classsrc.transformers.models.fsmt.tokenization_fsmt.FSMTTokenizer
Construct an FAIRSEQ Transformer tokenizer.
classsrc.transformers.models.gemma3n.modeling_gemma3n.Gemma3nTextLaurelBlock
Learned Augmented Residual Layer
classsrc.transformers.models.gemma3n.modular_gemma3n.Gemma3nTextLaurelBlock
Learned Augmented Residual Layer
funcsrc.transformers.models.gemma4.convert_gemma4_weights.store(path:str, weights, dtype=None)
Store a tensor in the HF tree.
classsrc.transformers.models.gemma4.modeling_gemma4.Gemma4VisionModel
The Gemma 4 Vision Encoder.
classsrc.transformers.models.gemma4.modular_gemma4.Gemma4VisionModel
The Gemma 4 Vision Encoder.
classsrc.transformers.models.gemma4_unified.modeling_gemma4_unified.Gemma4UnifiedModel
Encoder-free multimodal model.
classsrc.transformers.models.gemma4_unified.modular_gemma4_unified.Gemma4UnifiedModel
Encoder-free multimodal model.
classsrc.transformers.models.glm4_moe.modeling_glm4_moe.Glm4MoeMoE
A mixed expert module containing shared experts.
classsrc.transformers.models.glpn.modeling_glpn.GLPNOverlapPatchEmbeddings
Construct the overlapping patch embeddings.
classsrc.transformers.models.gpt2.tokenization_gpt2.GPT2Tokenizer
Construct a GPT-2 tokenizer.
classsrc.transformers.models.gpt_neo.modeling_gpt_neo.GPTNeoFlashAttention2
GPTNeo flash attention module.
classsrc.transformers.models.gpt_sw3.tokenization_gpt_sw3.GPTSw3Tokenizer
Construct an GPTSw3 tokenizer.
methodsrc.transformers.models.gpt_sw3.tokenization_gpt_sw3.GPTSw3Tokenizer.preprocess_text(text:str) -> str
Returns the preprocessed text.
classsrc.transformers.models.gptj.modeling_gptj.GPTJFlashAttention2
GPTJ flash attention module.
classsrc.transformers.models.groupvit.modeling_groupvit.GroupViTPatchEmbeddings
Image to Patch Embedding.
classsrc.transformers.models.hiera.modeling_hiera.HieraEmbeddings
Construct position and patch embeddings.
classsrc.transformers.models.hiera.modeling_hiera.HieraMaskUnitAttention
Computes either Mask Unit or Global Attention.
classsrc.transformers.models.hubert.modeling_hubert.HubertFeatureEncoder
Construct the features from raw audio waveform
classsrc.transformers.models.hy_v3.modeling_hy_v3.HYV3Experts
Collection of expert weights stored as 3D tensors.
classsrc.transformers.models.ibert.modeling_ibert.IBertClassificationHead
Head for sentence-level classification tasks.
classsrc.transformers.models.ibert.modeling_ibert.IBertLMHead
I-BERT Head for masked language modeling.
classsrc.transformers.models.ibert.quant_modules.IntGELU
Quantized version of `torch.nn.GELU`.
classsrc.transformers.models.ibert.quant_modules.IntLayerNorm
Quantized version of `torch.nn.LayerNorm`.
classsrc.transformers.models.ibert.quant_modules.IntSoftmax
Quantized version of `torch.nn.Softmax`.
classsrc.transformers.models.ibert.quant_modules.QuantAct
Quantizes the given activation.
classsrc.transformers.models.ibert.quant_modules.QuantEmbedding
Quantized version of `torch.nn.Embedding`.

About this data

These signatures were extracted from the public source of huggingface/transformers using Python's ast module. Argument names, default values, type annotations and return types are taken verbatim from the code. Implementation bodies are never stored. See how it works for details.

Back to all 805 libraries