4267

Состав NVIDIA CUDA. Модель программирования CUDA

Контрольная

Информатика, кибернетика и программирование

Состав NVIDIA CUDA CUDA включает два API: высокого уровня (CUDA Runtime API) и низкого (CUDA Driver API), хотя в одной программе одновременное использование обоих невозможно, нужно использовать или один или другой. Высокоуровневый работает «сверху» ...

Русский

2012-11-15

118.94 KB

28 чел.

Состав NVIDIA CUDA

CUDA включает два API: высокого уровня (CUDA Runtime API) и низкого (CUDA Driver API), хотя в одной программе одновременное использование обоих невозможно, нужно использовать или один или другой. Высокоуровневый работает «сверху» низкоуровневого, все вызовы runtime транслируются в простые инструкции, обрабатываемые низкоуровневым Driver API. Но даже «высокоуровневый» API предполагает знания об устройстве и работе видеочипов NVIDIA, слишком высокого уровня абстракции там нет. 

Есть и ещё один уровень, даже более высокий — две библиотеки:

CUBLAS CUDA вариант BLAS (Basic Linear Algebra Subprograms), предназначенный для вычислений задач линейной алгебры и использующий прямой доступ к ресурсам GPU;

CUFFT — CUDA вариант библиотеки Fast Fourier Transform для расчёта быстрого преобразования Фурье, широко используемого при обработке сигналов. Поддерживаются следующие типы преобразований: complex-complex (C2C), real-complex (R2C) и complex-real (C2R).

Модель программирования CUDA

CUDA использует параллельную модель вычислений, когда каждый из SIMD процессоров выполняет ту же инструкцию над разными элементами данных параллельно. GPU является вычислительным устройством, сопроцессором (device) для центрального процессора (host), обладающим собственной памятью и обрабатывающим параллельно большое количество потоков. Ядром (kernel) называется функция для GPU, исполняемая потоками (аналогия из 3D графики — шейдер).

Мы говорили выше, что видеочип отличается от CPU тем, что может обрабатывать одновременно десятки тысяч потоков, что обычно для графики, которая хорошо распараллеливается. Каждый поток скалярен, не требует упаковки данных в 4-компонентные векторы, что удобнее для большинства задач. Количество логических потоков и блоков потоков превосходит количество физических исполнительных устройств, что даёт хорошую масштабируемость для всего модельного ряда решений компании.

Модель программирования в CUDA предполагает группирование потоков. Потоки объединяются в блоки потоков (thread block) — одномерные или двумерные сетки потоков, взаимодействующих между собой при помощи разделяемой памяти и точек синхронизации. Программа (ядро, kernel) исполняется над сеткой (grid) блоков потоков (thread blocks), см. рисунок ниже. Одновременно исполняется одна сетка. Каждый блок может быть одно-, двух- или трехмерным по форме, и может состоять из 512 потоков на текущем аппаратном обеспечении. 

Блоки потоков выполняются в виде небольших групп, называемых варп (warp), размер которых — 32 потока. Это минимальный объём данных, которые могут обрабатываться в мультипроцессорах. И так как это не всегда удобно, CUDA позволяет работать и с блоками, содержащими от 64 до 512 потоков. Кеплер позволяет определять на 1 варп до 2048 потоков.

Модель памяти CUDA

Модель памяти в CUDA отличается возможностью побайтной адресации, поддержкой как gather, так и scatter. Доступно довольно большое количество регистров на каждый потоковый процессор, до 1024 штук. Доступ к ним очень быстрый, хранить в них можно 32-битные целые или числа с плавающей точкой.

Каждый поток имеет доступ к следующим типам памяти: 

Глобальная память — самый большой объём памяти, доступный для всех мультипроцессоров на видеочипе, размер составляет от 256 мегабайт до 1.5 гигабайт на текущих решениях (и до 4 Гбайт на Tesla). Обладает высокой пропускной способностью, более 100 гигабайт/с для топовых решений NVIDIA, но очень большими задержками в несколько сот тактов. Не кэшируется, поддерживает обобщённые инструкции load и store, и обычные указатели на память.

Локальная память — это небольшой объём памяти, к которому имеет доступ только один потоковый процессор. Она относительно медленная — такая же, как и глобальная.

Разделяемая память — это 16-килобайтный (в видеочипах нынешней архитектуры) блок памяти с общим доступом для всех потоковых процессоров в мультипроцессоре. Эта память весьма быстрая, такая же, как регистры. Она обеспечивает взаимодействие потоков, управляется разработчиком напрямую и имеет низкие задержки. Преимущества разделяемой памяти: использование в виде управляемого программистом кэша первого уровня, снижение задержек при доступе исполнительных блоков (ALU) к данным, сокращение количества обращений к глобальной памяти.

Память констант — область памяти объемом 64 килобайта (то же — для нынешних GPU), доступная только для чтения всеми мультипроцессорами. Она кэшируется по 8 килобайт на каждый мультипроцессор. Довольно медленная — задержка в несколько сот тактов при отсутствии нужных данных в кэше.

Текстурная память — блок памяти, доступный для чтения всеми мультипроцессорами. Выборка данных осуществляется при помощи текстурных блоков видеочипа, поэтому предоставляются возможности линейной интерполяции данных без дополнительных затрат. Кэшируется по 8 килобайт на каждый мультипроцессор. Медленная, как глобальная — сотни тактов задержки при отсутствии данных в кэше.

Естественно, что глобальная, локальная, текстурная и память констант — это физически одна и та же память, известная как локальная видеопамять видеокарты. Их отличия в различных алгоритмах кэширования и моделях доступа. Центральный процессор может обновлять и запрашивать только внешнюю память: глобальную, константную и текстурную. 

CUDA предполагает специальный подход к разработке, не совсем такой, как принят в программах для CPU. Нужно помнить о разных типах памяти, о том, что локальная и глобальная память не кэшируется и задержки при доступе к ней гораздо выше, чем у регистровой памяти, так как она физически находится в отдельных микросхемах.

Типичный, но не обязательный шаблон решения задач:

  1.  задача разбивается на подзадачи;
  2.  входные данные делятся на блоки, которые вмещаются в разделяемую память;
  3.  каждый блок обрабатывается блоком потоков;
  4.  подблок подгружается в разделяемую память из глобальной;
  5.  над данными в разделяемой памяти проводятся соответствующие вычисления;
  6.  результаты копируются из разделяемой памяти обратно в глобальную.

Парадигма программирования подразумевает под собой не только тип программирования, но и среду разработки. В последнее время стали пользоваться огромной популярностью мобильные телефоны. А они соответственно имеют свою ОС. Наиболее известные – Symbian, WM, Android, IOS.

Каждая из этих ОС имеет свою среду разработки, на которых подробнее мы останавливаться не будем.

Рассмотрим еще одно направление программирования для ПК с точки зрения среды разработки – WPF.

Windows Presentation Foundation (WPF) — система для построения клиентских приложений Windows с визуально привлекательными возможностями взаимодействия с пользователем, графическая (презентационная) подсистема в составе .NET Framework (начиная с версии 3.0), использующая язык XAML.

WPF предустановлена в Windows Vista(.NET Framework 3.0) и Windows 7(.NET Framework 3.5 SP1). С помощью WPF можно создавать широкий спектр как автономных, так и запускаемых в браузере приложений.

 WPF позволяет расширить возможности программиста и дизайнера вместе с помощью продукта от MicrosoftBlend. Это ПО позволяет создавать XAML одинаковый как для программиста, так и для дизайнера. Больше нет этого сложного перехода.

Основные преимущества WPF:

  1.  Декларативное определение UI – XAML
  2.  Вовлечение дизайнеров
  3.  Универсальный подход работы с любыми медиа-источниками
  4.  Векторная отрисовка
  5.  Аппаратное ускорение
  6.  3D
  7.  Легкость разворачивания

Главной, на мой взгляд, особенностью является то, что именно за WPF будущее программирования. В современных условиях у этой технологии есть один важный плюс – ориентированность на пользователя. Выделяется эта технология тем, что она вполне внедрима как в WinForm, так и WinForm внедрима в нее. Впредь эта технология будет расширяться и внедряться в массы.


 

А также другие работы, которые могут Вас заинтересовать

17441. Головні ідеї Філософії життя Ф. Ніцше 17.6 KB
  Головні ідеї Філософії життя Ф. Ніцше Наприкінці XIX у першій половині XX ст. в Європі набула популярності філософія життя найпомітнішими представниками якої були Ф. Ніцше З. Фрейд А. Бергсон які відійшли від онтологічної та характерної для класичної філософії гн...
17442. Інтуїтивізм А. Бергсона 16.86 KB
  Інтуїтивізм А. Бергсона Один із філософських напрямів кінця XIX початку XX століть інтуїтивізм пов'язаний передусім з іменем видатного французького філософа лауреата Нобелівської премії Анрі Бергсона 18591941. Інтуїтивізм Бергсона складна суперечлива т...
17443. Характеристика напрямків філософії XX ст. 29.75 KB
  Характеристика напрямків філософії XX ст. Початок XX століття ознаменувався революційними змінами в науці відкриттям атома й електрона побудовою теорії відносності та квантової механіки а також становленню психології фрейдизму. На початку століття інтен
17444. Основні ідеї філософської позиції екзистенціалізму 21.53 KB
  Основні ідеї філософської позиції екзистенціалізму Екзистенціалі́зм фр. existentialisme від лат. exsistentia існування Філософія існування напрям у філософії XX ст. що позиціонує і досліджує людину як унікальну духовну істоту що здатна до вибору власної долі. Основни...
17445. Проблеми людини та її свободи у філософії Ж. П. Сартра 17.51 KB
  Проблеми людини та її свободи у філософії Ж. П. Сартра Вихідний пункт екзистенціалізму за Сартром це проблема яку вирішують герої Достоєвського: якщо Бога немає то все дозволено. Разом з Богом зникає можливість знайти якінебудь цінності у надчуттєвому світі. Немає ...
17446. Ветвление: полная форма 108.89 KB
  Лабораторная работа № 7 Ветвление: полная форма 7.1. Вложенные операторы lf...Then Внутрь оператора If_Then можно поместить еще один оператор If_Then. Второй оператор If_Then будет выполняться только если условие в первом выполняется. Второй оператор находится внутри первого. Гово...
17447. Циклы со счетчиком 90.54 KB
  Лабораторная работа № 8 Циклы со счетчиком 8.1. Циклы For ...Next Циклы используются для многократного выполнения одних и тех же операторов кода. Иногда программе нужно повторять какието действия раз за разом пока она не выполнит их нужное количество раз. Поэтому во всех я
17448. Циклы с условием 129.61 KB
  Лабораторная работа № 9 Циклы с условием 9.1. Циклы Do While...Loop Есть множество операций которые нужно повторять пока чтото не произойдет. Это чтото представляет собой условие прекращения процесса. Код в цикле с неопределенным количеством повторений выполняется неиз...
17449. Подпрограммы и функции 59.85 KB
  Лабораторная работа № 10 Подпрограммы и функции Это интересно: В 2003 году была создана система объектноориентированного программирования Visual Basic .NET 2003 а в 2005 году система объектноориентированного программирования Visual Basic 2005 Express Edition затем Visual Basic 2008 потом Visual Basi...