본문 바로가기 대메뉴 바로가기
    I-SOFT SOLUTION

    GPU 기반 AI 서버환경 구축

    AI 서비스 및 데이터 분석 서비스 구축

    Ollama · Local LLM JupyterHub 데이터 분석 NVIDIA H200 · RTX 5090 내부망 · 폐쇄망 구성
    주식회사 아이소프트 | Smart ICT Partner
    1
    GPU AI 서버 구축
    AI 서비스를 통한 분석 지원
    데이터분석 환경 시스템 구축
    AI 서비스를 통한 개발 지원
    A 서버

    AI WebUI + Ollama

    일반 질의응답
    • 자연어 질의응답 기반으로 소스 생성·데이터 분석 추천 등 다양한 질의응답 활용
    • 최신 모델 기반 일반 질의응답 (Gpt-Oss, Gemma3 등)
    B 서버

    JupyterHub

    데이터 분석 환경
    • Python 기반 오픈소스 소프트웨어로 각종 라이브러리 활용
    • 데이터 분석 및 머신러닝 등에 유용한 분석 환경 제공
    C 서버

    AI WebUI + Ollama

    개발 및 Vision
    • 자연어 질의응답 기반으로 소스 생성·데이터 분석 추천 등 활용
    • 최신 모델 기반 개발·Vision 질의응답 (devstral, Llama4, Gemma3 등)
    2
    CASE 1 – 내부망 AI 서버 구성도
    일반 사용자
    AI 서비스 접속
    A 서버 · AI 서비스(분석용)
    AI WebUI
    + Ollama
    • GPU : H200 2EA
    • 데이터 분석용 모델 기반 구축
    • AI 모델 : Gpt-Oss 등
    C 서버 · AI 서비스(개발용)
    AI WebUI
    + Ollama
    • GPU : H200 2EA
    • 개발자용 모델 기반 구축
    • AI 모델 : devstral-2, llama4, Gemma4
    서버 종류구성 방안비고
    A 서버AI WebUI + OllamaAI 서비스 (일반 모델 Load : Gpt-Oss 등) / MedGemma (의료 분야 구축 모델)
    B 서버JupyterHub데이터 분석 서비스
    C 서버AI WebUI + OllamaAI 서비스 (개발 모델 Load : devstral-2, llama4, Gemma4 등 멀티모달 포함)
    2
    CASE 1 – 소프트웨어 스택 상세

    모든 서버는 Ubuntu 22.04 LTS 이상 운영체제를 기반으로 하며, 하드웨어 제어를 위해 NVIDIA DriverCUDA Toolkit이 설치됩니다. 그 위에 NVIDIA Container Toolkit을 배치하여 Docker 컨테이너가 GPU 하드웨어에 직접 접근하는 파이프라인을 구성합니다.

    런타임
    Docker CE
    (Ollama + AI WebUI, JupyterHub 등)
    런타임
    NVIDIA Container Toolkit
    GPU 드라이버
    NVIDIA Driver (최신 프로덕션 브랜치)
    운영체제
    운영체제 (우분투 22.04 이상)
    애플리케이션의 격리 실행

    A·C 서버 : Ollama + AI WebUI / B 서버 : JupyterHub

    GPU 자원 할당

    Docker 컨테이너가 GPU 하드웨어에 직접 접근하도록 연결

    커널 레벨 드라이버

    H200의 기능을 온전히 활용하기 위한 커널 레벨 드라이버

    안정성이 검증된 리눅스 배포판

    AI 프레임워크와의 호환성이 가장 높은 운영체제

    2
    CASE 1 – 개발 환경 연동 가이드
    Dev PC
    VSCode
    Network
    <C-Server-IP>:11434
    C-Server
    Ollama : Devstral-2 123B
    config.yaml 파일 예제
    models:
     - name: Devstral-2
        apiBase: http://<C_Server_IP>:11434
        provider: ollama
    Chat API (Conversational)
    curl http://localhost:11434/api/chat -d '{
     "model": "exaone3.5:7.8b",
     "messages": [{"role":"user",
       "content":"코드 리뷰해줘"}],
     "stream": false }'
    Generate API (Completion)
    curl http://localhost:11434/api/generate -d '{
     "prompt": "Python DataFrame 예제",
     "model": "devstral-2:123b" }'
    
    Response: 'response','done',
    'eval_duration'
    VSCODE 사용법
    VSCode 사용법 — Tab/Ctrl+I/Ctrl+L 단축키
    3
    CASE 2 – 의료 분야 AI 아키텍처 구성도
    바이오뱅크 오픈랩 폐쇄망 시스템 구성도

    SERVER
    SPEC

    워크스테이션

    Ryzen 9 · DDR5 64GB · RTX 5090 32GB

    SW · AI 스택

    JupyterHub · Python/R · LLM WebUI · Local LLM

    보안 계층

    USB 제어 · 포트락 · 캡처방지 · 복원

    외부 인터넷과 물리적 분리 · 외부 전송 없음
    3
    CASE 2 – 의료 분야 AI 서버 구성도
    연구자
    AI 서비스 접속
    의료 분야 AI 서비스
    AI WebUI
    + Ollama
    • GPU : RTX 5090 1EA
    • 데이터 분석용 모델 기반 구축
    • AI 모델 : medgemma 등
    데이터 분석 서비스
    Jupyter
    Hub
    • JupyterHub 데이터분석 도구 접속
    • NVIDIA NGC Container 기반
    • Python · PyTorch · TensorFlow
    medgemmagemma4
    구분구성 방안비고
    AI 서비스AI WebUI + OllamaAI 서비스 (일반 모델 Load : medgemma 등)
    데이터 분석JupyterHub데이터 분석 서비스 (JupyterHub – NVIDIA NGC Container 기반)
    [ AI 모델 선정 ]
    • RTX 5090 32G GPU 기반 환경에 Medgemma(또는 Gemma4)를 통한 텍스트·의료지·이미지 분석 결과를 생성형 AI로 질의응답 가능하도록 구성
    • Gemma4 : gemma4:26b 또는 gemma4:31b 가능
    • Medgemma : medgemma:27b 이하 모델 가능
    • Gemma4 · Medgemma 2개 동시 사용은 검토 필요