본문으로
WriteWithin

텍스트 문자 정리

비라틴어 스크립트를 손상시키지 않고 하나의 개인 브라우저 도구에서 특수 문자, 이모티콘, 기호, 숫자, 악센트 및 보이지 않는 정크를 제거합니다.

사전 설정

특수 및 기호

문자 및 숫자

보이지 않는 & 통제

인용문 & Unicode

나만의 규칙

처리 순서는 고정되어 있습니다. 정규화 → 보이지 않음 → 제어 → 따옴표 → 악센트 → 이모티콘 → 문자 클래스 → 사용자 정의 규칙 → ASCII → 깔끔함.

이 도구가 다른 이유

  • 스크립트를 이해하는 악센트 제거 - 힌디어, 아랍어, 히브리어, 태국어가 엉망이 아닌 표시를 유지합니다.
  • 이모티콘은 전체 클러스터로 표시되므로 가족, 깃발, 피부색에 눈에 보이지 않는 잔여물이 남지 않습니다.
  • 기호와 구두점은 하나의 모호한 "특수 문자" 버킷 대신 별도의 스위치입니다.
  • 자신의 문자를 유지하거나 제거하여 대시나 밑줄을 정리 후에도 유지할 수 있습니다.
  • 네 가지 Unicode 정규화 형식이 모두 일반 언어로 설명되어 있습니다.
  • 16개 언어로 개인 브라우저 내 처리

특수 문자를 제거하는 방법

특수 문자를 제거하면 구두점과 기호가 함께 지워지고 문자, 숫자, 공백은 유지됩니다. 그 중 하나만 원하는 경우 별도의 구두점 제거 및 기호 제거 스위치를 대신 사용하십시오.

영숫자가 아닌 문자 제거

영숫자가 아닌 문자를 제거하면 모든 언어의 문자와 숫자만 유지됩니다. 공백 유지를 끄면 모든 내용이 끊어지지 않는 하나의 문자열로 축소됩니다. 이는 ID와 코드에 편리합니다.

텍스트에서 숫자 제거

숫자를 제거하면 0~9뿐만 아니라 아랍어 인도어 및 Devanagari 숫자를 포함하여 모든 스크립트에서 숫자가 삭제됩니다.

텍스트에서 문자 제거

문자 제거는 숫자, 구두점 및 공백을 남기고 모든 스크립트에서 문자를 제거합니다. 구두점 제거와 함께 사용하면 지저분한 붙여넣기에서 깨끗한 숫자를 뽑아낼 수 있습니다.

텍스트에서 이모티콘 제거

이모티콘 제거는 각 이모티콘을 전체 단위로 삭제합니다. 가족 이모티콘, 국기 또는 피부색이 있는 손을 흔드는 것이 하나의 클러스터이므로 나중에 텍스트가 깨질 수 있도록 눈에 보이지 않는 것이 남지 않습니다.

텍스트에서 기호 제거

기호를 제거하면 더하기, 등호, 달러, 유로 등의 수학, 통화 및 기호 문자가 대상으로 지정됩니다. 구두점을 제거하지 않는 한 쉼표 및 마침표와 같은 구두점은 그대로 유지됩니다.

텍스트에서 악센트 제거

악센트를 제거하면 카페가 카페로 바뀌고 Ελλάδα가 Ελλαδα로 바뀌게 됩니다. Devanagari, 아랍어, 히브리어, 태국어 및 Cyrillic은 의도적으로 건너뜁니다. 왜냐하면 이러한 스크립트에서 표시는 장식이 아닌 문자의 일부이기 때문입니다.

스마트 인용 변환

곧은 스마트 따옴표는 둥근 따옴표와 아포스트로피를 일반 따옴표로 대체합니다. 이는 코드, CSV 파일 및 이전 시스템에서 기대하는 것입니다. 스마트한 직선 따옴표는 게시와 반대입니다. ASCII에 대한 대시 및 줄임표는 en 대시, em 대시 및 단일 문자 줄임표도 병합합니다.

보이지 않는 문자 제거

안전 모드는 너비가 0인 공백과 바이트 순서 표시를 제거합니다. 공격적 모드는 또한 일부 아랍어 및 인도어 텍스트에 필요한 결합자를 제거하므로 텍스트가 필요하지 않다는 것을 알고 있는 경우에만 접근하십시오. 방향 표시를 제거하면 양방향 재정의와 소프트 하이픈이 지워집니다.

Unicode 텍스트 정규화

NFC은 문자와 기호를 단일 문자로 구성하여 저장 및 검색에 가장 안전한 선택입니다. NFD은 그것들을 분리합니다. NFKC 및 NFKD은 더 나아가 유사 항목을 접어 멋진 글꼴, 합자 및 원으로 둘러싸인 숫자를 일반 텍스트로 만듭니다.

제어 문자 제거

제어 문자 제거는 Null 바이트와 데이터베이스 및 내보내기를 중단시키는 기타 보이지 않는 제어 코드를 지웁니다. 탭 유지 및 줄 바꿈은 기본적으로 켜져 있으므로 레이아웃이 유지됩니다.

관련 도구

공백 정리 · 줄 도구 · 대소문자 변환 · URL 정리

캐릭터 수준의 정리가 중요한 이유

일부 텍스트 문제는 공간이 얼마나 많은지에 관한 것이 아닙니다. 어떤 캐릭터 사본에서 살아 남았습니다. Microsoft Word은 JSON을 구분하는 둥근 따옴표를 삽입합니다. 디자인 도구는 일반 텍스트 편집기가 잘못 처리하는 엠 대시 및 줄임표 문자를 내보냅니다. Emoji는 레거시 시스템에서 상자로 렌더링됩니다. OCR 출력은 읽을 수 있는 문장을 통해 섹션 기호와 소프트 하이픈을 분산시킵니다. RTL 붙여넣기의 너비가 0인 조이너는 검색 색인을 자동으로 중단합니다.

그만큼 WriteWithin Text Character Cleaner 업로드 없이 브라우저에서 문자 클래스, Unicode 정규화 및 사용자 정의 유지/제거 규칙을 대상으로 합니다. Whitespace Cleaner에 이미 간격이 고정되어 있지만 기호, 이모티콘 또는 보이지 않는 제어 코드가 여전히 문제를 일으키는 경우에 사용하세요.

이 도구가 제거하고 유지하는 것

특수, 영숫자가 아닌 숫자 및 문자

특수 문자 제거는 문자, 숫자, 공백을 유지하면서 구두점과 기호를 함께 지웁니다. 더 세밀하게 제어하려면 구두점 제거와 기호 제거를 별도로 전환하세요. 쉼표와 마침표는 구두점입니다. 더하기, 같음 및 통화 기호는 기호입니다.

영숫자가 아닌 문자를 제거하면(문자와 숫자만 유지) 모든 스크립트에서 다른 모든 항목이 제거됩니다. 결과를 깨지지 않는 하나의 문자열로 축소하려면 공백 유지를 끄십시오. ID, 슬러그 및 일치하는 키에 편리합니다. 0-9뿐만 아니라 모든 숫자 시스템에서 숫자 삭제 숫자를 제거합니다. 문자 제거는 모든 스크립트에서 문자를 제거하고 해당 옵션이 꺼져 있는 경우 숫자와 구두점을 남겨둡니다.

이모티콘 클러스터 및 기호

이모티콘 제거는 각 이모티콘을 전체 단위로 삭제합니다. 가족 이모티콘, 국가 국기 및 피부색 수정자에는 내부적으로 너비가 0인 결합자가 포함됩니다. 클리너는 전체 클러스터를 제거하므로 보이지 않는 남은 부분이 나중에 텍스트를 손상시키지 않습니다. 더하기, 등호, 달러, 유로와 같은 수학, 통화 및 기호 문자를 대상으로 하는 기호를 제거하고 구두점도 제거하지 않는 한 그대로 둡니다.

악센트 및 스크립트 인식 동작

악센트를 제거하면 어떤 스크립트가 표시를 장식으로 취급하는지 이해하는 분해를 사용하여 카페를 카페로, Ελλάδα를 Ελλαδα로 바꿉니다. 표시가 문자의 일부인 Devanagari, 아랍어, 히브리어, 태국어 및 Cyrillic을 의도적으로 건너뜁니다. 블라인드 제거는 의미를 손상시킵니다. 이 스크립트 인식 접근 방식은 일반적인 "발음 부호 제거" 도구에서 종종 잘못되는 부분입니다.

둥근 따옴표, 대시 및 활자체 구두점

곧은 스마트 따옴표는 둥근 따옴표와 아포스트로피를 일반 ASCII(코드 CSV 및 이전 데이터베이스에서 기대하는 것)으로 대체합니다. 스마트한 직선 따옴표는 게시와 반대입니다. 대시 직선화는 en 대시, em 대시 및 단일 문자 줄임표를 ASCII 하이픈과 점 3개로 변환합니다.

투명 및 제어 문자

안전한 보이지 않음 모드는 너비가 0인 공백과 바이트 순서 표시를 제거합니다. 공격적 모드는 아랍어 및 인도어 텍스트가 필요할 수도 있는 결합자를 제거합니다. 콘텐츠가 영향을 받지 않는다는 것을 알고 있는 경우에만 사용하십시오. 방향 표시 제거는 혼합된 RTL/LTR 붙여넣기를 스크램블하는 양방향 재정의 및 관련 컨트롤을 지웁니다. 제어 문자를 제거하면 데이터베이스를 손상시키는 널 바이트 및 기타 보이지 않는 코드가 삭제됩니다. 레이아웃이 유지되도록 탭과 줄 바꿈이 기본적으로 유지됩니다.

Unicode 정규화: NFC, NFD, NFKC, NFKD

NFC은 문자와 결합 기호를 단일 문자로 구성합니다. 이는 저장 및 검색에 가장 안전한 기본값입니다. NFD는 이들을 분리합니다. NFKC 및 NFKD은 더 나아가 호환 문자를 접어 멋진 글꼴, 합자 및 원으로 둘러싸인 숫자를 일반 텍스트로 만듭니다. 사용자 생성 컨텐츠를 엄격한 ASCII 시스템으로 가져올 때 NFKC을 선택하십시오. 일반 다국어 저장을 위해서는 NFC을 선택하세요. WriteWithin.

사용자 정의 문자 유지 및 제거

문자 유지는 공격적인 정리 후에도 유지되어야 하는 기호(하이픈, 밑줄, 파일 이름 점)를 나열합니다. 문자 제거는 다른 토글에 관계없이 제거할 정확한 코드 포인트 또는 리터럴을 나열합니다. Keep alnum을 Keep 문자 -_와만 쌍으로 연결하세요. 각 마크가 어떤 기호 클래스에 속하는지 추측하지 않고 파일 이름이 안전한 출력을 위해.

일반 작업에 대한 사전 설정

  • 일반 텍스트 — NFC, 보이지 않는 안전한 제거, 직선 따옴표, 직선 대시, 컨트롤 정리, 깔끔한 공백
  • 파일 이름 안전 — 악센트 끄기, 이모티콘 끄기, alnum 플러스 -_. 만, ASCII만
  • 이름 목록 — 이모티콘 및 기호 끄기, 숫자 끄기, 깔끔한 공간
  • 숫자만 — 스트립 문자, 이모티콘, 기호, 구두점
  • 문자만 — 스트립 번호, 이모티콘, 기호
  • ASCII 안전하다 — NFKC, 악센트 끄기, 이모티콘 끄기, 곧은 따옴표, ASCII 전용

Character Cleaner 대 Whitespace Cleaner

그만큼 Whitespace Cleaner 반복되는 공백을 축소하고, NBSP을 바꾸고, 탭을 변환하고, PDF 줄 바꿈을 수정하고, 선택적으로 빈 줄을 제거합니다. 이모티콘, 구두점 클래스 또는 스마트 따옴표는 제거되지 않습니다. Word 붙여넣기가 "정확한" 간격을 표시하지만 여전히 JSON 구문 분석기에 실패하는 경우 문제는 일반적으로 공백 수준이 아닌 문자 수준의 둥근 따옴표 또는 엠 대시입니다.

Character Cleaner에는 기호를 제거한 후 가벼운 축소를 위한 깔끔한 공간이 포함되어 있지만 간격이 많이 걸리는 작업(PDF 조인, NBSP 정규화, 보이지 않는 미리 보기)의 경우 Whitespace Cleaner을 먼저 사용하세요. 일반적인 체인: Whitespace Cleaner → Character Cleaner → Line Tools 목록 중복 제거용.

Case Converter 문자가 안정된 후에 문자 대소문자의 모양을 변경합니다. URL Cleaner 링크 매개변수를 처리합니다. Line Counter 수정하지 않고 조치합니다.

단계별: 코드 또는 CSV용 텍스트 준비

  1. 내보낸 문서를 Character Cleaner.
  2. 일반 텍스트 또는 ASCII 안전 사전 설정을 적용합니다.
  3. 스마트 따옴표를 확인하여 대시를 곧게 펴고 직선화하세요.
  4. 안전하게 보이지 않는 제거를 활성화하고 제어 문자를 제거합니다.
  5. 출력을 복사하여 IDE, JSON 파일 또는 CSV 가져오기 도구에 붙여넣습니다.

단계별: 파일 이름이 안전한 문자열 만들기

  1. 파일 이름 안전 사전 설정(NFKC, 악센트 제거, 이모티콘 끄기, alnum만)을 적용합니다.
  2. Keep 문자 추가 -_. 밑줄이나 점이 남아 있어야 하는 경우.
  3. 대상 파일 시스템에서 요구하는 경우에만 ASCII을 켜십시오.
  4. 기호 제거 후 남은 간격을 축소하려면 깔끔한 공간을 활성화하세요.
  5. CMS에서 파일을 복사하고 이름을 바꾸거나 슬러그 필드를 만듭니다.

피해야 할 일반적인 실수

  • 아랍어 또는 힌디어 텍스트의 악센트 제거 — 도구는 의미 있는 스크립트를 건너뛰지만 공격적인 보이지 않음 모드는 여전히 참여자에게 해를 끼칠 수 있습니다. 다국어 붙여넣기에서는 보이지 않는 안전한 것을 선호합니다.
  • 이모티콘만 의미하는 경우 특수 제거 사용 — 구두점을 유지하려면 이모티콘만 제거하세요.
  • 여기서 PDF 라인 수리가 예상됩니다 — 하드 줄 바꿈은 Whitespace Cleaner 작업입니다.
  • NFKC 예쁘게 보이고 싶은 텍스트 표시 — NFKC 문체 변형을 접습니다. 사람이 직접 보는 사본에는 NFC을 사용하세요.
  • Keep 탭과 줄바꿈 잊어버리기 — 이 기능을 끄면 구조화된 로그가 평면화됩니다. 한 줄이 정말로 필요한 경우에만 비활성화하십시오.

스크립트 인식 문자 정리의 이점

  • 이모티콘이 전체 클러스터로 제거됨 - 보이지 않는 결합자가 남지 않음
  • 악센트 제거는 표시가 의미를 전달하는 스크립트를 존중합니다.
  • 기호, 구두점, 숫자, 문자에 대한 별도의 스위치
  • 일반 언어 사전 설정이 포함된 4개의 Unicode 정규화 형식 모두
  • 민감한 초안 및 고객 데이터에 대한 비공개 브라우저 내 처리

실제 사용 사례

JSON 및 API 페이로드: 곧은 따옴표, 제어 문자 없음, NFC 정규화. 전자상거래 SKU 정리: 문자와 숫자만 가능하며 기호는 꺼집니다. SMS에 대한 소셜 게시물 준비: 이모티콘은 꺼지고 악센트는 선택사항입니다. OCR 및 PDF 붙여넣기: Whitespace Cleaner과 결합한 다음 여기에서 섹션 기호와 홀수 기호를 제거합니다. 파일 이름 배치: ASCII safe preset with custom keep characters for dots and hyphens in version numbers.

일반적인 질문

악센트를 제거하면 힌디어, 아랍어 또는 태국어가 손상되나요? 아니요. 악센트 제거는 라틴어 및 그리스 장식 표시를 대상으로 합니다. Devanagari, 아랍어, 히브리어, 태국어 및 Cyrillic 표시는 그대로 유지됩니다.

기호와 특수문자의 차이점은 무엇인가요? 기호는 수학, 통화 및 + = $ €와 같은 기호입니다. 구두점은 , 입니다. ! ? 그리고 따옴표. 특수 클리어를 둘 다 제거하십시오. 각 클래스를 전환할 수도 있습니다.

이모티콘을 제거하면 남은 음식이 남나요? 아니요. 피부색, 플래그, 패밀리를 포함한 클러스터는 하나의 단위로 제거됩니다.

어떤 Unicode 양식을 사용해야 합니까? NFC 일반 저장용; NFKC 엄격한 시스템을 위해 유사 문자 및 호환성 문자를 접을 때.

내 텍스트가 업로드됐나요? 아니요. 문자 정리는 전적으로 브라우저에서 실행됩니다.

자주 묻는 질문

악센트를 제거하면 힌디어, 아랍어 또는 태국어 텍스트가 손상됩니까?

아니요. 악센트 제거는 표시가 장식인 라틴어와 그리스어에만 적용됩니다. Devanagari, 아랍어, 히브리어, 태국어 및 Cyrillic에서는 표시가 문자의 일부이므로 그대로 둡니다.

기호와 특수문자의 차이점은 무엇인가요?

기호는 + = $ €와 같은 수학, 통화 및 기호 문자입니다. 구두점은 , 와 같은 표시입니다. ! ? 그리고 따옴표. 특수 문자를 제거하면 두 가지가 동시에 지워지고 각 문자를 개별적으로 전환할 수도 있습니다.

이모티콘을 제거하면 남은 음식이 남나요?

아니요. 패밀리, 플래그, 피부색 등 결합된 이모티콘은 단일 단위로 제거되므로 너비가 0인 결합자나 변형 선택기가 남지 않습니다.

어떤 Unicode 정규화 형식을 사용해야 합니까?

NFC은 텍스트를 저장하고 비교하는 데 안전한 기본값입니다. NFD은 표시에서 문자를 분리합니다. NFKC 및 NFKD은 또한 유사 문자를 접어 화려한 글꼴, 합자 및 원으로 둘러싸인 숫자를 일반 문자로 바꿉니다.

내 텍스트가 업로드됐나요?

아니요. 문자 정리는 전적으로 브라우저에서 실행됩니다. 텍스트는 절대 장치를 떠나지 않습니다.