전체 글

개요 목적 Keybert 모델 skt/kober-base-v1을 활용하여 문장별로 중요 키워드를 추출 뒤 엘라스틱 서치에 적재 환경 OS : CentOS Linux 7 (Core) elasticesearch 8.9.0 kiabana 8.9.0 Python 3.11.4 모듈 Kiwipiepy는 한국어 형태소 분석기인 Kiwi(Korean Intelligent Word Identifier)의 Python 모듈 keybert 모듈과 pre train 된 skt/kobert-base-v1을 기본 모델 Elasticsearch 모듈 과정 1. 기본 키워드 추출 모델을 사용하여 키워드만 추출해내는 함수 def get_keywords(): model = BertModel.from_pretrained('skt/..
개요 목적 한글 형태소 kiwi 분석기를 사용하여 python으로 문장별로 elasticsearch 적재 환경 OS : CentOS Linux 7 (Core) elasticesearch 8.9.0 kiabana 8.9.0 Python 3.11.4 모듈 Kiwipiepy는 한국어 형태소 분석기인 Kiwi(Korean Intelligent Word Identifier)의 Python 모듈 Elasticsearch 모듈 과정 1. Kiwipiepy를 이용하여 input 데이터 전처리 input 파일을 읽고 Kiwi 모듈을 사용하여 문장별로 데이터를 전처리 from kiwipiepy import Kiwi from PUT_func import put def file_open(path): with open(path..
개요 파이썬 설치 한두 번 하는 것도 아니고 할 때마다 찾는 나의 두뇌를 믿을 수 없어서 정리한다 환경 CentOS 7 과정 1. 루트 계정 접속 su - root 2. 파이썬 다운로드 및 압축 해제 원하는 버전을 확인해서 다운로드 페이지에서 다운 귀찮으면 그냥 숫자만 바꿔서 링크 한 번 접속해 보면 됨 wget https://www.python.org/ftp/python/3.9.1/Python-3.9.1.tgz tar xvfz Python-3.9.1.tgz 3. 파이썬 컴파일 시간 좀 걸림 cd Python-3.9.1.tgz ./configure --enable-optimizations make altinstall 4. 파이썬 버전 확인 python3.9 -V 5. 파이썬 경로 확인 whereis py..
문제 얀에서는 매년 달리기 경주가 열립니다. 해설진들은 선수들이 자기 바로 앞의 선수를 추월할 때 추월한 선수의 이름을 부릅니다. 예를 들어 1등부터 3등까지 "mumu", "soe", "poe" 선수들이 순서대로 달리고 있을 때, 해설진이 "soe"선수를 불렀다면 2등인 "soe" 선수가 1등인 "mumu" 선수를 추월했다는 것입니다. 즉 "soe" 선수가 1등, "mumu" 선수가 2등으로 바뀝니다. 선수들의 이름이 1등부터 현재 등수 순서대로 담긴 문자열 배열 players와 해설진이 부른 이름을 담은 문자열 배열 callings가 매개변수로 주어질 때, 경주가 끝났을 때 선수들의 이름을 1등부터 등수 순서대로 배열에 담아 return 하는 solution 함수를 완성해주세요. 제한 사항 5 ≤ p..
개요 NFS(Network File System) : 네트워크를 통해 디렉토리를 공유할 수 있는 분산 파일 시스템 프로토콜 시스템에 원격 디렉토리를 마운트하고 원격 시스템의 파일을 로컬 파일인 것처럼 작업 기본적으로 NFS 프로토콜은 암호화되지 않으며 사용자 인증을 제공하지 않음 서버에 대한 액세스는 클라이언트의 IP 주소 또는 호스트 이름에 의해 제한 환경 Ubuntu 22.04.3 LTS 서버 1. NFS 패키지 설치 apt update apt-get install nfs-common nfs-kernel-server rpcbind 2. NFS 버전 확인 (base) jy@jys:~$ sudo cat /proc/fs/nfsd/versions -2 +3 +4 +4.1 +4.22 3. 파일 시스템 공유 설..
· 빅데이터
하둡을 설치하면 주키퍼가 알아서 깔리는 경우가 있다던데 직접 설치하고 싶어서 찾아본 포스팅을 참조하였다. ZooKeeper란? 주키퍼는 분산 처리 프로그램의 분산 코디네이션 서비스로 활용된다. 다수의 노드에서 수행되는 분산 처리 어플리케이션은 단일 노드에서 수행되는 어플리케이션보다 매우 고려해야 할 요소가 많은데 그중 중요한 것은 부분 실패. 제대로 성공을 했는지 여부를 알고 안전하게 처리하기 위한 분산 처리 도구를 제공 6. Zookeeper 설치 서버 한 대에서 Zookeeper를 설치하고 환경 설정을 한 후에 복사한다. name01에서만 이하 작업 수행 6-1. Zookeeper 설치 root 계정으로 접속하여 wget을 설치 su - root sudo yum install wget zookeepe..
· 빅데이터
https://about2weeks.tistory.com/41 [hadoop] 하둡 클러스터 구축하기 1. 자바 설치 클러스터 사용 목적 : 스파크를 이용하여 카프카에서 consume하는 데이터 분산 처리 및 분석 접속 OS - macOS Monterey Version 12.5 VM OS - centOS7 서버 4대 name01 : Acitve 네임노드 name02 : StandBy 네임노드 data01 : about2weeks.tistory.com 위 포스트에서 이어 주키퍼, 하둡을 위한 계정 생성 및 디렉토리 설정을 할 것이다. 3. 계정 생성 계정에 대한 linux 명령어는 아래에서 더 자세히 참조 가능 https://about2weeks.tistory.com/40 3-1. Zookeeper 계정 ..
· 빅데이터
클러스터 사용 목적 : 스파크를 이용하여 카프카에서 consume하는 데이터 분산 처리 및 분석 접속 OS - macOS Monterey Version 12.5 VM OS - centOS7 서버 4대 name01 : Acitve 네임노드 name02 : StandBy 네임노드 data01 : 데이터노드1 data02 : 데이터노드2 서버가 각각 ip 할당 및 hosts 설정까지 끝났다는 전제 (ip 할당 및 hosts 설정 포스트 추후 추가) 우선 yum 업데이트를 해준다 sudo yum -y update 1. 자바 설치 사용하려는 노드 4대 모두 동일하게 설치해 줘야 한다 1-1. 자바 명령어 yum install -y java-1.8.0-openjdk-devel.x86_64 1-2. 자바 설치 완료 ..
· 기초/linux
1. 리눅스 사용자 목록 추가 centOS 기준 adduser zookeeper passwd zookeeper 비밀번호로 원하는 값을 입력하면 된다 2. 리눅스 사용자 목록 조회 리눅스를 사용할 때 사용자를 조회해야 할 때가 있다 사용자 전체 목록 조회 방법 cat /etc/passwd 아이디만 보는 법 cut -f1 -d: /etc/passwd bash 사용자 목록 useradd로 계정을 만들시에는 기본적으로 /bin/bash 환경이 적용 grep /bin/bash /etc/passwd 아이디만 보는 명령어 grep /bin/bash /etc/passwd | cut -f1 -d:
· 빅데이터
문제 원인 필요한 jar 파일이 없어서 2023-01-12 15:05:08,700 [main] ERROR org.apache.sqoop.tool.ImportTool - Import failed: java.io.IOException: java.lang.ClassNotFoundException: org.apache.hadoop.hive.conf.HiveConf at org.apache.sqoop.hive.HiveConfig.getHiveConf(HiveConfig.java:50) at org.apache.sqoop.hive.HiveImport.getHiveArgs(HiveImport.java:337) at org.apache.sqoop.hive.HiveImport.executeExternalHiveScrip..
2weeks
2 weeks