Noong

고정 헤더 영역

글 제목

메뉴 레이어

Noong

메뉴 리스트

  • 홈
  • 태그
  • 방명록
  • 분류 전체보기 (17)
    • 가짜 연구소_NLP 스터디 (10)
    • 졸업 프로젝트 (0)
    • 공부 (0)
    • AWS (5)
    • 네이버 boostcourse (0)
    • 코딩테스트 (0)
    • 중요 (0)
    • Datacamp (0)

검색 레이어

Noong

검색 영역

컨텐츠 검색

전체 글

  • 데이터 엔지니어링

    2023.01.09 by Noong_yoon

  • 데이터 전문가 - elastic

    2023.01.05 by Noong_yoon

  • Deep Learning on AWS

    2023.01.04 by Noong_yoon

  • Building Data Analytics Solutions Using Amazon Redshift

    2023.01.03 by Noong_yoon

  • Building Data Lakes on AWS

    2023.01.02 by Noong_yoon

  • [NLP 스터디]15-16장

    2022.11.29 by Noong_yoon

  • [NLP 스터디] 14장. BERT

    2022.11.22 by Noong_yoon

  • [NLP]CNN & 트랜스포머

    2022.11.15 by Noong_yoon

데이터 엔지니어링

Elastic Stack - Kibana, ElasticSearch, Logstash의 적합한 버전을 합쳐둔 것(통합해둔 것) Beats - Ship data from the source - Metric은 Metric beats, logs는 Filebeat로 다르게 가져와야하는데 Elastic Agent는 선택만 하면 자동으로 가져오게 됨 Cluster : ElasticSearch 시스템을 구성하는 가장 큰 단위 다수의 노드로 구성 하나의 클러스터를 다수의 서버로 바인딩해서 운영, 또는 역으로 하나의 서버에서 다수의 클러스터의 운용 가능 Node : Elasticsearch를 구성하는 하나의 단위 프로세스 다수의 샤드로 구성됨 같은 클러스터명을 가진 노드들은 자동으로 바인딩됨 Index : Documen..

AWS 2023. 1. 9. 09:37

데이터 전문가 - elastic

2023.01.05 Elasticsearch는 데이터를 수집, 검색(쿼리) 및 분석할 수 있는 데이터 플랫폼(초고속 DBMS) - 대용량 데이터(테라~페타급)도 실시간 수집/분석이 가능 - 세상의 모든 데이터 형태 저장 - 데이터를 유기적으로 조합하고 분석 - 보안분석, 마케팅/비즈니스, 검색으로 활용 - 속도, 확장성, 유연성, 복원력 특장점 - 다양한 기능(Monitoring, Metrics, Security, APM, Search) - Elastic을 가지고 시계열 데이터에 많이 적용 - APM 상관분석 : 에러의 원인을 자동으로 식별하는 혁신적인 기능 - User Activity Monitoring : 접속한 User 식별, Heavy 유저 식별, 접속 위치 추적 - Elastic XDR(Endp..

AWS 2023. 1. 5. 09:37

Deep Learning on AWS

모듈1. 기계 학습 소개 모듈2. 딥 러닝 소개 모듈3. AWS 기반 MXNet 소개 모듈4. AWS에 스마트 애플리케이션 배포 인공지능 - general AI(인간과 유사하게 많은 것을 할 수 있는 인공지능) - narrow(얼굴인식 등의 범위가 좁은 것들) 기계학습 - 비지도학습(차원축소, 군집화) Supervised : 인간이 알려주지 않고(선생님이 없고) 기계가 데이터로부터 학습을 하는 것 즉 기계가 레이블 자체를 파악하여 생성하는 것 Ex. 데이터 간의 거리 등을 계산해 유사한 데이터들끼리 묶는 것 Ex. 과속 감시 카메라 장애 감시, 공장 제품 분류 - 지도학습(회귀, 다중 분류, 이중 분류) Unsupervised : 인간이 알려준, 이미 레이블(Y = class, target)이 지정된 데..

AWS 2023. 1. 4. 09:45

Building Data Analytics Solutions Using Amazon Redshift

- Data Islands : 데이터가 흩어져있는 형태 - Data Warehouses : 기업 내 데이터를 중앙 집중식으로 수집, 저장 -> 최종 사용자의 의사결정을 지원하기 위함 - Analytic Sandbox : 데이터를 우선 Load해두고 나중에 필요할 때 Transform --> 일반화된게 Data Lake - 데이터 사일로 : 여러 업무분야의 데이터를 연합해서 분석하고 싶은 배경에서 출발 - Structured (schema, table 형식처럼) - Semi-Structured (json, xml처럼) - "Quasi"Structured (유사정형 데이터,, Web click stream 데이터(웹에서 클릭하면서 발생하는 데이터)) - Unstructured data (데이터 자체의 구조가..

AWS 2023. 1. 3. 11:24

Building Data Lakes on AWS

- 데이터 수집, 카탈로그 작성 및 준비 - S3, Glue - 데이터 처리 및 분석 - S3, Glue, Athena - Aws Lake Formation을 사용한 데이터 레이크 구축 - Lake Formation - Aws Lake Formation 추가 구성 - Lake Formation, QuickSight (모두 서버리스(Serverless) 서비스) Chap1. 데이터 레이크 소개 - 정형 데이터 : 형식이 결정된대로 데이터 수집 (대표적 : RDB(Relational Database로 Table형태, SQL 이용)) - 반정형 데이터 : 어느정도 형식이 존재하는 데이터 ( CSV, XML, JSON ) - 비정형 데이터 : 형식이 없는 텍스트, 이미지, 동영상 데이터 * 전에는 정형 데이터가..

AWS 2023. 1. 2. 10:25

[NLP 스터디]15-16장

- 검증 데이터셋은 학습을 하면서 학습 상황을 모니터링하고 학습과 관련한 하이퍼 파라미터를 조정하는데 쓰인 다. 즉 학습 도중에도 모형의 일반화 성능을 체크하면서 하이퍼 파라미터를 조정하는데 사용한다. 일반화와 관련해 검증 데이터셋을 통해 과적합 점검 가능 일정 단위마다 학습 데이터셋에 대한 성능과 검증 데이터셋에 대한 성능을 계산해서 추이를 보면 어느 시점부터 과적합이 발생했는지 알 수 있다. 보통 검증 데이터셋에 대한 성능이 오히려 떨ㅇ지기 시작하면 과적합이 발생하는 시점으로 볼 수 있다. - 평가 데이터셋은 모형의 학습에 관여하지 않고 온전하게 평가에만 사용돼야 하므로, 특히 딥러닝 학습에는 검증 데이터셋을 사용하는 것이 일반적! - - y = [0 if rate

카테고리 없음 2022. 11. 29. 21:00

[NLP 스터디] 14장. BERT

Encoder의 구조 - Multi Head Attention - Add & Norm - Feed Forward neural network Decoder의 구조 - Masked Multi Head Attention - 미래의 단어에 Attention을 적용하면 안되기에 Masking - Multi Head Attention - Add & Norm - Feed Forward neural network Post-processing - Linear layer - Softmax layer - 가장 높은 확률값을 가지고 있는 것이 다음 단어가 된다 BERT - Pre-train : 사전 학습 - Downstream task : 구체적인 문제 에 적용되는 방법 - L (the number of layers) , A..

가짜 연구소_NLP 스터디 2022. 11. 22. 22:42

[NLP]CNN & 트랜스포머

- CNN 등장으로 딥러닝을 통해 이미지 인식을 위한 특성을 잡아냄 - CNN : 이미지의 특징을 잡아내기 위한 모델 - 최종적으로 구해지는 행렬을 "feature map"이라고 한다. - CNN에서는 Pooling연산(Pixel 수를 줄이는) -> max pooling, average pooling이 사용 - Convolution(합성곱 연산), Pooling이 적절히 반복되고 마지막에 fully connected layer를 두어 요약정보를 받아 최종 분류 CNN이 적용된다면? 이미지 분류 문서 분류 목적 픽셀 중심으로 윈도우 내에 있는 픽셀 파악 -> 주변 정보 요약 단어 중심으로 앞뒤 단어의 문맥 파악 -> 주변 정보 요약 데이터 형태 2차원 이미지 벡터(색상이 반영되면 3차원) 2차원 벡터(단어..

가짜 연구소_NLP 스터디 2022. 11. 15. 22:50

추가 정보

인기글

최신글

페이징

이전
1 2 3
다음
TISTORY
Noong © Magazine Lab
페이스북 트위터 인스타그램 유투브 메일

티스토리툴바